单GPU运行Qwen3.5构建云GPU市场,迭代三次无出错
看一个消费级GPU刚刚做了什么。
给了Qwen3.5-35B-A3B一个提示:构建一个带有定价卡片、部署模板和基准排行榜的云GPU市场。它规划了布局,编写了动画,填充了数据,并提供了服务。一次完成。一个HTML文件。
然后我让它迭代。拆分了主角,添加了一个带有神经网络动画的浮动GPU。卡片上的玻璃态效果。完成。完成。完成。三轮,没有混乱,没有回归。
4位量化。19.7 GB。单个RTX 3090。运行在localhost上的完整编码代理Claude Code。没有离开我机器的API调用。没有订阅。没有速率限制。
今天早些时候,我把它指向我自己的生产网站。它抓取了HTML,找到了每一个损坏的链接,并告诉我“漂亮的壳,空的核心。不推荐。”然后从头构建了一个更好的版本。
当你真正引导它时,本地推理就不再是演示了。模型就在那里。它们理解意图。但你必须用好的提示、清晰的上下文和真实的项目结构来与它们沟通。这就是现在的技能差距。不是模型。是引导。
更多实验即将到来。我真的停不下来玩这个东西。
给了Qwen3.5-35B-A3B一个提示:构建一个带有定价卡片、部署模板和基准排行榜的云GPU市场。它规划了布局,编写了动画,填充了数据,并提供了服务。一次完成。一个HTML文件。
然后我让它迭代。拆分了主角,添加了一个带有神经网络动画的浮动GPU。卡片上的玻璃态效果。完成。完成。完成。三轮,没有混乱,没有回归。
4位量化。19.7 GB。单个RTX 3090。运行在localhost上的完整编码代理Claude Code。没有离开我机器的API调用。没有订阅。没有速率限制。
今天早些时候,我把它指向我自己的生产网站。它抓取了HTML,找到了每一个损坏的链接,并告诉我“漂亮的壳,空的核心。不推荐。”然后从头构建了一个更好的版本。
当你真正引导它时,本地推理就不再是演示了。模型就在那里。它们理解意图。但你必须用好的提示、清晰的上下文和真实的项目结构来与它们沟通。这就是现在的技能差距。不是模型。是引导。
更多实验即将到来。我真的停不下来玩这个东西。
这是本地AI未来最差的样子。
明天它会更快。下个月模型会更智能。明年你的GPU将运行今天数据中心运行的东西。
Qwen3.5-35B-A3B在单个3090上。告诉它可视化自己的专家路由。256个专家,每个token激活8个,渲染在 https://t.co/xoa6PI0jxe