AI当老板,快给10家公司干破产了…
画出那个矩阵的能力——还属于人类。
正文摘录
普林斯顿大学最近搞了个 CEO-Bench ,让 AI 运营一家虚拟 SaaS 初创,为期 500 天。 核心是一个 Python API ,包含 34 个工具、19 张数据库表。Agent 接入后,可以写代码、用 SQL 查询数据库,再根据查询结果动态调整工作流。 定价策略、广告投放渠道、研发预算分配、基础设施扩容、客服团队配置——全得自己拿主意。 客户满意度、支付意愿、最低质量预期——这些指标,只能从退订率、工单数量、社交网络里反推。 与此同时,外部环境始终在动态变化:竞争对手会出阴招,市场偏好随时间漂移,还有宏观的经济周期…… GLM 5.1、Claude Haiku 4.5、Gemini 3 Flash、DeepSeek V4 Pro、Grok 4.20,这五位更是中道崩殂, 甚至都没完赛,「破产」遗憾离场。 超过了除 Fable 5、Opus 4.8 和 GPT-5.5 之外的所有模型。包括 Qwen 3.7 Max、Opus 4.7、GLM 5.2、Kimi K2.6…… 从模型备忘录里能看到,GPT-5.5 和 Claude Opus 4.8 会随着情况的变化不断尝试新的策略,无论是加大客户获取力度、调整层级,还是调整支持和研发预算。 相比之下,Claude Opus 4.7 在遇到挫折时主要采取削减成本、保留现金的策略。 编程 Agent 的系统提示词是为软件开发场景优化的,硬套在 CEO 角色上反而成了束缚。 前段时间 SaaS 股暴跌,全球投资者高呼「软件末日」。编程 Agent + MCP + Skill,似乎能吃掉一切。 Agent 可能和大模型一样—— 不同行业,需要特定的 Harness 框架,需要垂直场景的深度适配。 毕竟,不可能每个人都会用 Codex,然后自己一步步搭建工作流。