开源项目

gstack

gstack

将 Claude Code 扩展为虚拟工程团队的 23 个专属工具集,覆盖从产品构思、CEO 评审、架构设计到 QA 测试和发布的完整开发流程。由 YC CEO Garry Tan 亲自日常使用并开源,核心亮点在于把单个 AI agent 编排成多个角色(CEO/设计师/QA/安全官等)协作,而非简单的一问一答,配合并行 sprint 机制可大幅提升个人产出。MIT 许可,免费使用。

README

gstack

"我觉得自去年12月以来,我可能基本上没写过一行代码,这是一个极其巨大的变化。" — Andrej Karpathy,No Priors 播客,2026年3月

听到 Karpathy 这么说,我想知道他是怎么做到的。一个人怎么能像一个二十人团队一样交付?Peter Steinberger 打造了 OpenClaw —— 247K GitHub stars —— 基本上 solo 借助 AI agents 完成。革命已经到来。一个拥有正确工具的独立开发者的速度可以超过传统团队。

我是 Garry Tan,Y Combinator 的总裁兼 CEO。我曾与数千家初创公司合作过 —— Coinbase、Instacart、Rippling —— 当时他们只有一两个人在车库里。在 YC 之前,我是 Palantir 最早期的工程师/产品经理/设计师之一,共同创立了 Posterous(被 Twitter 收购),并构建了 YC 的内部社交网络 Bookface。

gstack 就是我的答案。 我从事产品开发二十年,而现在我交付的产品比以往任何时候都多。在过去60天里:3个生产级服务,40+个已交付功能,兼职完成,同时全职运营 YC。按逻辑代码变更计算(而非原始 LOC,AI 会夸大原始行数),我2026年的运行速度是 2013年的约810倍(每日逻辑代码行数从14行增长到11,417行)。截至2026年4月18日,2026年已经产生了 2013年全年的240倍。测量范围包括40个公开+私有 garrytan/* 仓库(包括 Bookface),排除一个演示仓库后。大部分代码由 AI 编写。重点不在于谁键入了这些代码,而在于交付了什么。

LOC 批评者说原始代码行数会因 AI 而膨胀,这没有错。但他们错了的是:经通胀调整后,我的生产力并没有降低,而是大幅提高了。完整方法论、注意事项和复现脚本:关于 LOC 争议。

2026年 —— 1,237次贡献,且还在增长:

GitHub 贡献图 2026 —— 1,237次贡献,1-3月大幅加速

2013年 —— 我在 YC 构建 Bookface 时(772次贡献):

GitHub 贡献图 2013 —— 在 YC 构建 Bookface 时772次贡献

同一个人。不同的时代。差别在于工具。

gstack 就是我实现的方式。 它将 Claude Code 转变为一个虚拟工程团队 —— 一个重新思考产品的 CEO,一个锁定架构的工程经理,一个发现 AI 垃圾设计的设计师,一个发现生产 bug 的评审者,一个打开真实浏览器的 QA 负责人,一个运行 OWASP + STRIDE 审计的安全官,以及一个发布 PR 的发布工程师。23个专家和8个强力工具,全部通过斜杠命令,全部用 Markdown 编写,全部免费,MIT 许可证。

这是我的开源软件工厂。我每天都在使用它。我与大家分享它,因为这些工具应该对每个人都可用。

Fork 它。改进它。让它成为你的。如果你想要抨击免费开源软件 —— 欢迎你这么做,但我更希望你先试一试。

适用人群:

  • 创始人兼 CEO —— 特别是那些仍然想亲自交付产品的技术型创始人
  • Claude Code 新手 —— 结构化的角色,而非空白提示
  • 技术主管和资深工程师 —— 对每个 PR 进行严格审查、QA 和发布自动化

快速开始

  1. 安装 gstack(30秒 —— 见下方)
  2. 运行 /office-hours —— 描述你要构建什么
  3. 对任何功能构思运行 /plan-ceo-review
  4. 对有变更的分支运行 /review
  5. 对 staging URL 运行 /qa
  6. 到此为止。你会知道它是否适合你。

安装 —— 30秒

条件: Claude Code、Git、Bun v1.0+、Node.js(仅限 Windows)

步骤1:在你的机器上安装

打开 Claude Code 并粘贴以下内容。Claude 会完成其余部分。

安装 gstack:运行 git clone --single-branch --depth 1 https://github.com/garrytan/gstack.git ~/.claude/skills/gstack && cd ~/.claude/skills/gstack && ./setup,然后在 CLAUDE.md 中添加一个 "gstack" 部分,说明所有网页浏览都使用 gstack 的 /browse 技能,绝不使用 mcp__claude-in-chrome__* 工具,并列出可用的技能:/office-hours, /plan-ceo-review, /plan-eng-review, /plan-design-review, /design-consultation, /design-shotgun, /design-html, /review, /ship, /land-and-deploy, /canary, /benchmark, /browse, /connect-chrome, /qa, /qa-only, /design-review, /setup-browser-cookies, /setup-deploy, /setup-gbrain, /retro, /investigate, /document-release, /document-generate, /codex, /cso, /autoplan, /plan-devex-review, /devex-review, /careful, /freeze, /guard, /unfreeze, /gstack-upgrade, /learn。然后询问用户是否也想将 gstack 添加到当前项目中,以便队友也能获得。

步骤2:团队模式 —— 共享仓库的自动更新(推荐)

在你的仓库内部,粘贴以下内容。切换至团队模式,引导仓库让队友自动获得 gstack,并提交变更:

(cd ~/.claude/skills/gstack && ./setup --team) && ~/.claude/skills/gstack/bin/gstack-team-init required && git add .claude/ CLAUDE.md && git commit -m "require gstack for AI-assisted work"

仓库中没有 vendored 文件,没有版本漂移,没有手动升级。每次 Claude Code 会话都以快速自动更新检查开始(限制为每小时一次,网络故障安全,完全静默)。

如果你更倾向于提示队友而非阻止他们,请将 required 替换为 optional。

OpenClaw

OpenClaw 通过 ACP 生成 Claude Code 会话,因此当 Claude Code 安装了 gstack 时,所有 gstack 技能都能正常工作。将以下内容粘贴给你的 OpenClaw agent:

安装 gstack:运行 git clone --single-branch --depth 1 https://github.com/garrytan/gstack.git ~/.claude/skills/gstack && cd ~/.claude/skills/gstack && ./setup 为 Claude Code 安装 gstack。然后在 AGENTS.md 中添加一个 "Coding Tasks" 部分,说明:当为编码工作生成 Claude Code 会话时,告诉会话使用 gstack 技能。包括以下示例 —— 安全审计:"Load gstack. Run /cso",代码审查:"Load gstack. Run /review",QA 测试一个 URL:"Load gstack. Run /qa https://...", 端到端构建功能:"Load gstack. Run /autoplan, implement the plan, then run /ship", 规划后构建:"Load gstack. Run /office-hours then /autoplan. Save the plan, don't implement."

设置完成后,只需自然地与你的 OpenClaw agent 对话:

你说 发生的事情
"修复 README 中的拼写错误" 简单 —— Claude Code 会话,不需要 gstack
"对这个仓库进行安全审计" 启动 Claude Code 并执行 Run /cso
"为我构建一个通知功能" 启动 Claude Code 执行 /autoplan → implement → /ship
"帮我规划 v2 API 重设计" 启动 Claude Code 执行 /office-hours → /autoplan,保存计划

参见 docs/OPENCLAW.md 了解高级分发路由以及 gstack-lite/gstack-full 提示模板。

原生 OpenClaw 技能(通过 ClawHub)

四个方法论技能直接在你的 OpenClaw agent 中使用,无需 Claude Code 会话。从 ClawHub 安装:

clawhub install gstack-openclaw-office-hours gstack-openclaw-ceo-review gstack-openclaw-investigate gstack-openclaw-retro
技能 作用
gstack-openclaw-office-hours 产品质疑,6个强制性问题
gstack-openclaw-ceo-review 战略挑战,4种范围模式
gstack-openclaw-investigate 根因调试方法论
gstack-openclaw-retro 每周工程回顾

这些是对话式技能。你的 OpenClaw agent 通过聊天直接运行它们。

其他 AI Agents

gstack 适用于10种 AI 编码 agent,不只是 Claude。安装时会自动检测你已安装了哪些 agent:

git clone --single-branch --depth 1 https://github.com/garrytan/gstack.git ~/gstack
cd ~/gstack && ./setup

或者使用 ./setup --host <name> 针对特定 agent:

Agent 标志 技能安装到
OpenAI Codex CLI --host codex ~/.codex/skills/gstack-*/
OpenCode --host opencode ~/.config/opencode/skills/gstack-*/
Cursor --host cursor ~/.cursor/skills/gstack-*/
Factory Droid --host factory ~/.factory/skills/gstack-*/
Slate --host slate ~/.slate/skills/gstack-*/
Kiro --host kiro ~/.kiro/skills/gstack-*/
Hermes --host hermes ~/.hermes/skills/gstack-*/
GBrain (mod) --host gbrain ~/.gbrain/skills/gstack-*/

想要为另一个 agent 添加支持? 参见 docs/ADDING_A_HOST.md。只需要一个 TypeScript 配置文件,无需修改代码。

看看它是如何工作的

你:    我想为我的日历构建一个每日简报应用。
你:    /office-hours
Claude: [询问痛点 —— 具体例子,而非假设]

你:    多个 Google 日历,事件信息过时,位置错误。
        准备时间太长而且结果不够好...

Claude: 我将会挑战你这个构想框架。你说的是"每日简报应用"。
        但实际上你描述的是一个个人 AI 参谋长。
        [提取了你自己都没意识到的5项能力]
        [挑战了4个前提 —— 你同意、不同意或调整]
        [生成了3种实现方案及工作量估算]
        建议:明天先交付最窄的切入版本,从实际使用中学习。
        完整愿景是一个3个月的项目 —— 从一个真正有效的每日简报开始。
        [编写设计文档 → 自动传递给下游技能]

你:    /plan-ceo-review
        [阅读设计文档,挑战范围,进行10个部分的审查]

你:    /plan-eng-review
        [数据流、状态机、错误路径的 ASCII 图表]
        [测试矩阵、故障模式、安全问题]

你:    批准计划。退出计划模式。
        [在11个文件中编写了2,400行。大约8分钟。]

你:    /review
        [自动修复] 2个问题。[询问] 竞态条件 → 你批准修复。

你:    /qa https://staging.myapp.com
        [打开真实浏览器,点击流程,发现并修复了一个 bug]

你:    /ship
        测试数:42 → 51(+9个新测试)。PR:github.com/you/app/pull/42

你说"每日简报应用"。agent 说"你在构建一个 AI 参谋长" —— 因为它倾听的是你的痛点,而非你的功能需求。八个命令,端到端。这不是副驾。这是一个团队。

冲刺

gstack 是一个流程,而不是工具的集合。技能按照冲刺运行的顺序执行:

思考 → 规划 → 构建 → 审查 → 测试 → 交付 → 反思

每个技能都馈入下一个技能。/office-hours 编写设计文档,/plan-ceo-review 读取它。/plan-eng-review 编写测试计划,/qa 接着执行。/review 捕获 bug,/ship 验证它们是否已修复。没有任何事会遗漏,因为每一步都知道之前发生了什么。

技能 你的专家 他们的职责
/office-hours YC 办公时间 从这里开始。六个强制性问题,在你写代码之前重新框定你的产品。挑战你的构想框架,挑战假设,生成实现方案备选。设计文档会馈入所有下游技能。
/plan-ceo-review CEO / 创始人 重新思考问题。在请求中找到隐藏的10星产品。四种模式:扩展、选择性扩展、保持范围、缩减。
/plan-eng-review 工程经理 锁定架构、数据流、图表、边界情况和测试。把隐藏的假设暴露出来。
/plan-design-review 高级设计师 对每个设计维度打分0-10,解释什么样的设计得10分,然后编辑计划以达到该水平。AI 垃圾检测。交互式 —— 每个设计选择会有一个 AskUserQuestion。
/plan-devex-review 开发者体验负责人 交互式 DX 审查:探索开发者角色画像,对比竞争对手的 TTHW(从零到 Hello World 的时间),设计你的"魔法时刻",逐步追踪摩擦点。三种模式:DX 扩展、DX 打磨、DX 分诊。20-45个强制性问题。
/design-consultation 设计合作伙伴 从头构建完整的设计系统。调研领域,提出创意风险,生成真实的产品原型。
/review 资深工程师 发现那些通过 CI 但在生产中会炸的 bug。自动修复明显的 bug。标记完整性缺口。
/investigate 调试器 系统性的根因调试。铁律:没有调查就没有修复。追踪数据流,测试假设,在3次修复失败后停止。
/design-review 会写代码的设计师 与 /plan-design-review 相同的审计,然后修复发现的问题。原子提交,前后截图对比。
/devex-review DX 测试员 实时开发者体验审计。实际测试你的上手引导:浏览文档,尝试入门流程,计时 TTHW,截取错误信息。与 /plan-devex-review 分数对比 —— 这是验证你的计划是否符合实际的回旋镖。
/design-shotgun 设计探索者 "展示选项给我。" 生成4-6个 AI 原型变体,在浏览器中打开对比面板,收集你的反馈,然后迭代。品味记忆会学习你喜欢什么。重复直到你满意,然后交给 /design-html。
/design-html 设计工程师 将原型转化为实际可用的生产级 HTML。Pretext 计算布局:文本可重排,高度自适应,布局动态。30KB,零依赖。能检测 React/Svelte/Vue。根据设计类型(落地页 vs 仪表盘 vs 表单)智能路由 API。输出是可交付的,不只是演示。
/qa QA 负责人 测试你的应用,发现 bug,用原子提交修复它们,重新验证。为每个修复自动生成回归测试。
/qa-only QA 报告员 与 /qa 相同的方法论,但仅报告。纯 bug 报告,不修改代码。
/pair-agent 多 Agent 协调员 与任何 AI agent 共享你的浏览器。一个命令,一次粘贴,连接完成。适用于 OpenClaw、Hermes、Codex、Cursor,或任何能够 curl 的工具。每个 agent 拥有自己的标签页。自动启动有头模式以便你观察一切。自动启动 ngrok 隧道用于远程 agent。范围令牌、标签页隔离、速率限制、活动归属。
/cso 首席安全官 OWASP Top 10 + STRIDE 威胁模型。零噪音:17个误报排除项,8/10+置信度门槛,独立发现验证。每个发现都包含具体的漏洞利用场景。
/ship 发布工程师 同步 main 分支,运行测试,审计覆盖率,推送,打开 PR。如果你没有测试框架,则自举一个。
/land-and-deploy 发布工程师 合并 PR,等待 CI 并部署,验证生产状态。一个命令从"已批准"到"已在生产中验证"。
/canary SRE 部署后监控循环。监控控制台错误、性能回归和页面故障。
/benchmark 性能工程师 基线页面加载时间、Core Web Vitals 和资源大小。在每个 PR 上比较前后变化。
/document-release 技术写作员 更新所有项目文档以匹配你刚刚交付的内容。自动捕获过时的 README。构建 Diataxis 覆盖图(参考 / 操作指南 / 教程 / 解释),因此在 PR 主体中可见缺口。
/document-generate 文档作者 使用 Diataxis 框架从头生成缺失的文档。先研究代码库,然后编写与实际代码匹配的参考/操作指南/教程/解释文档。可独立调用,也可从 /document-release 链接调用(当覆盖图发现缺口时)。了解更多:教程 • 操作指南 • 为什么用 Diataxis。
/retro 工程经理 团队感知的每周回顾。按人分解、交付连续性、测试健康趋势、成长机会。/retro global 跨所有项目和 AI 工具(Claude Code、Codex、Gemini)运行。
/browse QA 工程师 给 agent 眼睛。真实的 Chromium 浏览器、真实点击、真实截图。每个命令约100ms。/open-gstack-browser 启动 GStack Browser,带侧边栏、反机器人隐身和自动模型路由。
/setup-browser-cookies 会话管理器 从你的真实浏览器(Chrome、Arc、Brave、Edge)导入 cookie 到无头会话。测试需要认证的页面。
/autoplan 审查流水线 一个命令,完全审查过的计划。自动运行 CEO → design → eng review,并带有编码决策原则。只呈现品味决策供你批准。
/learn 记忆 管理 gstack 跨会话学到的内容。审查、搜索、修剪和导出项目特定的模式、陷阱和偏好。学习跨会话叠加,使 gstack 在你的代码库上随着时间变得更好。

应该使用哪种审查?

为了构建... 计划阶段(编码前) 实时审计(交付后)
最终用户(UI、Web 应用、移动端) /plan-design-review /design-review
开发者(API、CLI、SDK、文档) /plan-devex-review /devex-review
架构(数据流、性能、测试) /plan-eng-review /review
以上所有 /autoplan(自动运行 CEO → design → eng → DX,自动检测哪些适用) —

强力工具

技能 作用
/codex 第二意见 —— 来自 OpenAI Codex CLI 的独立代码审查。三种模式:审查(通过/失败门控)、对抗性挑战和开放式咨询。当 /review 和 /codex 都运行过后,进行跨模型分析。
/careful 安全护栏 —— 在破坏性命令(rm -rf、DROP TABLE、force-push)之前发出警告。说"be careful"即可激活。可覆盖任何警告。
/freeze 编辑锁定 —— 将文件编辑限制在一个目录。防止在调试时意外修改范围外的代码。
/guard 完全安全 —— /careful + /freeze 合并为一个命令。生产环境工作的最大安全。
/unfreeze 解锁 —— 移除 /freeze 边界。
/open-gstack-browser GStack Browser —— 启动 GStack Browser,带侧边栏、反机器人隐身、自动模型路由(Sonnet 用于动作,Opus 用于分析)、一键 cookie 导入和 Claude Code 集成。清理页面、智能截图、编辑 CSS,以及将信息传回终端。
/setup-deploy 部署配置器 —— 一次性设置 /land-and-deploy。检测你的平台、生产 URL 和部署命令。
/setup-gbrain GBrain 上手引导 —— 从零到运行 gbrain 不到5分钟。PGLite 本地、Supabase 现有 URL,或通过 Management API 自动配置新的 Supabase 项目。用于 Claude Code 的 MCP 注册 + 每仓库信任三元组(读-写/只读/拒绝)。完整指南。
/sync-gbrain 保持大脑更新 —— 将此仓库的代码重新索引到 gbrain 中,通过 gbrain sources add + gbrain sync --strategy code,刷新 CLAUDE.md 中的 ## GBrain Search Guidance 块,并在能力检查失败时自动移除指导。--incremental(默认),--full,--dry-run。幂等;可安全重跑。
/gstack-upgrade 自更新器 —— 将 gstack 升级到最新版本。检测全局安装 vs vendored 安装,同步两者,显示变更内容。

新的二进制工具(v0.19)

除了斜杠命令技能外,gstack 还提供适合工作流程的独立 CLI,这些工作流程不适合在会话内部执行:

命令 作用
gstack-model-benchmark 跨模型基准测试 —— 在 Claude、GPT(通过 Codex CLI)和 Gemini 上运行相同提示;比较延迟、令牌数、成本,以及(可选)LLM 评判的质量分数。按 provider 检测认证,不可用的 provider 会干净地跳过。输出格式包括表格、JSON 或 markdown。--dry-run 验证标志和认证而不消耗 API 调用。
gstack-taste-update 设计品味学习 —— 将 /design-shotgun 中的批准和拒绝写入到持久的每个项目品味配置文件中。每周衰退5%。反馈到未来的变体生成中,使系统学习你实际选择的内容。

持续检查点模式(可选,默认本地)

设置 gstack-config set checkpoint_mode continuous,技能会在你工作时自动提交工作进度,使用 WIP: 前缀加上结构化的 [gstack-context] 主体(决策、剩余工作、失败的方案)。能在崩溃和上下文切换后存活。/context-restore 读取这些提交以重建会话状态。/ship 在 PR 前过滤并压缩 WIP 提交(保留非 WIP 提交),以便 git bisect 保持干净。推送是可选功能,通过 checkpoint_push=true 开启 —— 默认仅本地,以免每次 WIP 提交都触发 CI。

领域技能 + 原始 CDP 逃生口

两个新的浏览器基础组件随着时间的推移增强了 gstack agent 的能力:

  • $B domain-skill save —— agent 保存一个针对某个网站节点的笔记(例如:"LinkedIn 的 Apply 按钮在 iframe 中"),下次访问该主机名时自动触发。隔离状态 → 经过3次成功使用后变为活跃状态 → 可选跨项目提升,通过 $B domain-skill promote-to-global。存储与 /learn 的项目级学习文件相邻。完整参考:docs/domain-skills.md。
  • $B cdp <Domain.method> —— 原始 Chrome DevTools Protocol 逃生口,用于极少数精心策划的命令无法覆盖的情况。默认拒绝:方法必须显式添加到 browse/src/cdp-allowlist.ts 中,并附上一行理由说明。两层互斥锁将浏览器作用域的 CDP 调用序列化,与每个标签页的工作隔离。对于数据泄露方法的输出包裹在 UNTRUSTED 信封中。

想要完全没有轨道、没有白名单、没有守护进程的原始 CDP —— 只是从 agent 到 Chrome 的轻量传输?browser-use/browser-harness-js 是另一种理念(agent 编写的助手 vs gstack 的精心策划命令),如果你不想要 gstack 的安全栈,它是不错的选择。两者可以共存:gstack 的 $B cdp 和 harness 都可以通过 Playwright 的 newCDPSession 附加到同一个 Chrome 上。

每个技能的深度探讨、示例和理念 →

Karpathy 的四种失败模式?已经覆盖了。

Andrej Karpathy 的 AI 编码规则(17K stars)指出了四种失败模式:错误的假设、过度复杂化、正交编辑、命令式优于声明式。gstack 的工作流技能强制执行了所有四种。/office-hours 在编写代码之前将假设暴露出来。Confusion Protocol 阻止 Claude 在架构决策上猜测。/review 捕获不必要的复杂性和无关编辑。/ship 将任务转化为可验证的目标,测试先于执行。如果你已经使用 Karpathy 风格的 CLAUDE.md 规则,那么 gstack 是使这些规则在整个冲刺中保持一致的工作流执行层,而不仅仅是在单个提示中。

并行冲刺

gstack 在一个冲刺中表现良好。但十个同时运行时会变得有趣。

设计是核心。 /design-consultation 从头构建你的设计系统,调研已有的方案,提出创意风险,并编写 DESIGN.md。但真正的魔法是 shotgun-to-HTML 流水线。

/design-shotgun 是你进行探索的方式。 你描述你想要的。它使用 GPT Image 生成4-6个 AI 原型变体。然后在你的浏览器中打开一个对比面板,所有变体并排显示。你选择喜欢的,留下反馈("更多留白"、"更粗的标题"、"去掉渐变"),然后它会生成新的一轮。重复直到你满意为止。几轮后品味记忆开始起作用,它会偏向你实际喜欢的方向。不再需要用语言描述你的愿景并希望 AI 理解。你看到选项,选择好的,然后以可视方式迭代。

/design-html 让它变成现实。 把那个被批准的原型(来自 /design-shotgun、CEO 计划、设计审查,或仅仅一个描述)转化为生产质量的 HTML/CSS。不是那种在一个视口宽度下看起来不错、但在别处就崩溃的 AI HTML。它使用 Pretext 进行计算的文本布局:文本在调整大小时实际重排,高度随内容调整,布局动态。30KB 开销,零依赖。它检测你的框架(React、Svelte、Vue)并输出正确的格式。智能 API 路由根据是落地页、仪表盘、表单还是卡片布局选择不同的 Pretext 模式。输出是你实际会交付的东西,而不是演示。

/qa 是一个巨大的解锁。 它让我从6个并行 worker 增加到12个。Claude Code 说 "我看到问题了" 然后实际修复它,生成回归测试,并验证修复 —— 这改变了我的工作方式。agent 现在有眼睛了。

智能审查路由。 就像在一个运转良好的初创公司一样:CEO 不必查看底层 bug 修复,后端变更也不需要设计审查。gstack 跟踪哪些审查已运行,推断出哪些是合适的,然后自动做合理的事。审查就绪仪表板在交付前告诉你当前状态。

测试一切。 /ship 如果项目没有测试框架,则会从头引导一个。每次 /ship 运行都会产生覆盖率审计。每次 /qa bug 修复都会生成一个回归测试。100% 测试覆盖率是目标 —— 测试使 vibe coding 变得安全,而不是 yolo coding。

/document-release 是你从未拥有过的工程师。 它读取项目中的所有文档文件,与差异交叉引用,并更新所有漂移的内容。README、ARCHITECTURE、CONTRIBUTING、CLAUDE.md、TODOS —— 全部自动保持更新。现在 /ship 会自动调用它 —— 无需额外命令,文档保持最新。

真实浏览器模式。 /open-gstack-browser 启动 GStack Browser,一个由 AI 控制的 Chromium,具有反机器人隐身、自定义品牌和内置侧边栏扩展。Google 和 NYTimes 等网站无需验证码即可工作。菜单栏显示 "GStack Browser" 而不是 "Chrome for Testing"。你的常规 Chrome 保持不变。所有现有的浏览命令都能正常工作。$B disconnect 返回无头模式。浏览器在你工作时会一直保持打开状态...没有空闲超时在你工作时将其杀死。

侧边栏 agent —— 你的 AI 浏览器助手。 在 Chrome 侧面板中输入自然语言,一个子 Claude 实例会执行它。"导航到设置页面并截图。" "用测试数据填写此表单。" "逐个浏览此列表中的每个项目并提取价格。" 侧边栏会自动路由到正确的模型:Sonnet 用于快速动作(点击、导航、截图),Opus 用于阅读和分析。每个任务最多5分钟。侧边栏 agent 在隔离的会话中运行,因此不会干扰你的主 Claude Code 窗口。一键 cookie 导入就在侧边栏底部。

个人自动化。 侧边栏 agent 不仅用于开发工作流。例如:"浏览我孩子的学校家长门户,将所有其他家长的姓名、电话号码和照片添加到我的 Google 联系人中。" 两种获取认证的方式:(1) 在有头浏览器中登录一次,你的会话会持久化;(2) 点击侧边栏底部的 "cookies" 按钮从你的真实 Chrome 导入 cookie。一旦认证,Claude 会导航目录,提取数据,并创建联系人。

提示注入防御。 恶意网页试图劫持你的侧边栏 agent。gstack 提供分层防御:一个 22MB 的 ML 分类器与浏览器捆绑,本地扫描每个页面和工具输出;一个 Claude Haiku 转录检查对整个对话形状进行投票;一个随机 canary token 在系统提示中捕获 session 外泄尝试(跨文本、工具参数、URL 和文件写入);还有一个裁决合并器,要求两个分类器同意后再阻止(防止单个模型在 Stack Overflow 风格的指令页面上出现误报)。侧边栏头部中的盾牌图标显示状态(绿色/黄色/红色)。通过设置 GSTACK_SECURITY_ENSEMBLE=deberta 选择加入 721MB 的 DeBERTa-v3 集成,以获得2-of-3的一致同意。紧急关闭开关:GSTACK_SECURITY_OFF=1。参见 ARCHITECTURE.md 获取完整栈。

当 AI 卡住时,浏览器交接。 遇到 CAPTCHA、认证墙或 MFA 提示?$B handoff 在可见的 Chrome 窗口中打开同一个页面,保留所有 cookie 和标签页。解决问题,告诉 Claude 你完成了,$B resume 在你离开的位置继续工作。agent 甚至在连续3次失败后自动建议这么做。

/pair-agent 是跨 agent 协调。 你在 Claude Code 中。你同时运行着 OpenClaw。或者 Hermes。或者 Codex。你想让它们都看同一个网站。输入 /pair-agent,选择你的 agent,然后 GStack Browser 窗口打开以便你观察。技能打印一组指令。将该组指令粘贴到另一个 agent 的聊天中。它会交换一次性设置密钥以获取会话令牌,创建自己的标签页,并开始浏览。你看到两个 agent 在同一个浏览器中工作,各自在自己的标签页中,彼此不能干扰。如果安装了 ngrok,隧道会自动启动,因此另一个 agent 可以在完全不同的机器上。同机器的 agent 会获得一个零摩擦的快捷方式,可以直接写入凭据。这是第一次来自不同供应商的 AI agent 能够通过共享浏览器进行协调,并且具有真正的安全性:范围令牌、标签页隔离、速率限制、域限制和活动归属。

多 AI 第二意见。 /codex 从 OpenAI 的 Codex CLI 获得独立审查 —— 一个完全不同的 AI 查看同一个差异。三种模式:代码审查(通过/失败门控)、对抗性挑战(主动尝试破坏你的代码),以及带有会话连续性的开放咨询。当 /review(Claude)和 /codex(OpenAI)都审查过同一个分支时,你会得到一个跨模型分析,显示哪些发现是重叠的,哪些是各自独有的。

按需安全护栏。 说 "be careful",/careful 会在任何破坏性命令之前发出警告 —— rm -rf、DROP TABLE、force-push、git reset --hard。/freeze 在调试时将编辑锁定到一个目录,这样 Claude 就不会意外"修复"无关的代码。/guard 同时激活两者。/investigate 自动冻结到正在调查的模块。

主动技能建议。 gstack 会注意到你处于哪个阶段 —— 头脑风暴、审查、调试、测试 —— 并建议合适的技能。不喜欢?说 "stop suggesting",它会跨会话记住。

10-15个并行冲刺

gstack 在一个冲刺中很强大。但十个同时运行时,它具有变革性。

Conductor 并行运行多个 Claude Code 会话 —— 每个在自己的隔离工作区中。一个会话在运行 /office-hours 处理新想法,另一个在 /review

开源项目garrytan2026-05-14原文

相关内容