GenericAgent
极简的自我进化 Agent 框架,核心仅约 3K 行代码,通过 9 个原子工具让 LLM 控制系统。亮点是任务执行路径自动固化为 Skill 形成专属技能树,上下文窗口不到 30K,Token 消耗远低于同类 Agent。MIT 许可,可自由使用。
README
English | 中文 | 📄 技术报告:
| 📘 教程 | Sophub
📌 官方渠道: 本 GitHub 仓库是 GenericAgent 的唯一官方来源。我们与任何使用 GenericAgent 名称的第三方网站无关。
🌟 项目概述
GenericAgent 是一个极简的、可自我进化的自主 Agent 框架。其核心仅约 3K 行代码。通过 9 个原子工具 + 约 100 行的 Agent 循环,赋予任意 LLM 对本地计算机的系统级控制能力——覆盖浏览器、终端、文件系统、键盘/鼠标输入、屏幕视觉和移动设备(ADB)。
其设计哲学是:不预设技能——靠进化获得能力。
每解决一个新任务,GenericAgent 就会自动将执行路径固化为一个 Skill,供后续直接复用。使用时间越长,积累的技能越多,形成一棵完全属于你、从 3K 行种子代码生长出来的专属技能树。
🤖 自举实证 —— 本仓库中的一切,从安装 Git 并运行
git init到每一条 commit 消息,均由 GenericAgent 自主完成。作者从未打开过终端一次。
📋 核心特性
- 自我进化:每次任务自动沉淀 Skill,能力随使用持续增长,形成你的个人技能树。
- 极简架构:约 3K 行核心代码。Agent 循环约 100 行。无复杂依赖,零部署负担。
- 强执行力:注入真实浏览器(保留登录会话)。9 个原子工具直接控制系统。
- 高兼容性:支持 Claude / Gemini / Kimi / MiniMax 等主流模型。跨平台。
- 极致省 Token:上下文窗口低于 30K,是其他 Agent(消耗 200K–1M)的零头。分层记忆让关键信息始终在场。更少噪声,更低幻觉,更高成功率——而成本仅为一小部分。
🧬 自我进化机制
这是 GenericAgent 区别于所有其他 Agent 框架的根本所在。
[新任务] --> [自主探索] (安装依赖、编写脚本、调试验证) -->
[将执行路径固化为 Skill] --> [写入记忆层] --> [下次同类任务直接调用]
| 你说的话 | Agent 第一次做了什么 | 之后每次 |
|---|---|---|
| "读取我的微信消息" | 安装依赖 → 逆向数据库 → 编写读取脚本 → 保存 Skill | 一行调用 |
| "监控股票并提醒我" | 安装 mootdx → 构建选股流程 → 配置 cron → 保存 Skill | 一行启动 |
| "通过 Gmail 发送此文件" | 配置 OAuth → 编写发送脚本 → 保存 Skill | 立即可用 |
几周后,你的 Agent 实例将拥有一套世界上任何人都不具备的技能树——全部从 3K 行种子代码中生长而来。
🎯 演示展示
| 🧋 外卖下单 | 📈 量化选股 |
|---|---|
![]() |
![]() |
| "给我点杯奶茶" —— 自动导航外卖 App,选品并完成结账。 | "找出 EXPMA 金叉、换手率 > 5% 的创业板股票" —— 按量化条件筛选股票。 |
| 🌐 自主网页探索 | 💰 支出追踪 |
![]() |
![]() |
| 自主浏览并定期汇总网页内容。 | "查找近 3 个月超过 ¥2K 的支出" —— 通过 ADB 驱动支付宝。 |
📅 最新动态
- 2026-05-15: 🖥️ 桌面 GUI 发布 —— 一键安装现在附带可直接运行的桌面应用 (
frontends/GenericAgent.exe),开发者也可通过python launch.pyw启动。 - 2026-05-14: 🆕 Conductor 子 Agent 编排 —— 派发、监督、自动清理并行子 Agent;与
/btw旁路子 Agent 互补,提供一等公民级的任务委派原语。 - 2026-05-12: 🆕 TUI v2 发布 (
frontends/tuiapp_v2.py) —— 改进的 Textual 前端,支持图片粘贴折叠、文件粘贴、块删除、Ctrl+C 复制、历史导航、以及/llm//export//continue选择器。 - 2026-04-21: 📄 技术报告发布在 arXiv —— GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization
- 2026-04-11: 引入 L4 会话归档记忆,并集成 scheduler cron 调度
- 2026-03-23: 支持个人微信作为 Bot 前端
- 2026-03-10: 发布百万级 Skill 库
- 2026-03-08: 发布“Dintal 政务龙虾”——基于 GenericAgent 的政务机器人
- 2026-03-01: GenericAgent 被机器之心报道
- 2026-01-16: GenericAgent V1.0 公开版本发布
🚀 快速开始
⚠️ Python 版本: 请使用 Python 3.11 或 3.12。不要使用 Python 3.14——它与
pywebview及部分其他 GA 依赖不兼容。
📖 详细安装指南:installation.md · installation_zh.md(中文)
面向 LLM Agent
获取安装指南并照做:
curl -fsSL https://raw.githubusercontent.com/lsdefine/GenericAgent/refs/heads/main/docs/installation.md
面向人类用户
方式一:一行命令安装(推荐)
一键安装会准备好独立的 Python 环境和 Git,然后下载可直接运行的包。
Windows PowerShell
powershell -ExecutionPolicy Bypass -c "$env:GLOBAL=1; irm http://fudankw.cn:9000/files/ga_install.ps1 | iex"
Linux / macOS
GLOBAL=1 bash -c "$(curl -fsSL http://fudankw.cn:9000/files/ga_install.sh)"
安装完成后,从以下路径启动桌面应用:
frontends/GenericAgent.exe
方式二:Python 安装(面向开发者)
git clone https://github.com/lsdefine/GenericAgent.git
cd GenericAgent
uv venv
uv pip install -e ".[ui]" # 核心 + UI 依赖
cp mykey_template.py mykey.py # 填入你的 LLM API Key
python launch.pyw
GenericAgent 的设计更倾向于让 Agent 在执行过程中自举环境,而不是预先安装所有可能的包。
完整指南:GETTING_STARTED.md
🖥️ 前端
桌面应用
一键安装后,在 Windows 上双击启动:
frontends/GenericAgent.exe
终端 UI
基于 Textual 的轻量键盘驱动界面。支持多会话并发和实时流式输出。
python frontends/tuiapp_v2.py
Windows 上 TUI 故障排除。 TUI 在 Windows 上的渲染效果因终端和字体而异。常见原因:
textual不是最新版本——先执行pip install -U textual。- PowerShell / cmd 自带的终端对 Unicode 和键位绑定支持较差。Windows 上推荐使用 Git Bash,体验好得多。
- 如果仍然显示异常,可以让 GA 自行修复:
"我在 Windows 的 PowerShell / cmd / Git Bash 中使用
frontends/tuiapp_v2.py体验非常差,存在大量不兼容问题。请参考 Claude Code 在 Windows 终端的最佳实践,修复所有字体和渲染不兼容问题。"
Streamlit UI
python launch.pyw
💬 Bot 接口(IM)
GenericAgent 还支持 Telegram、微信、QQ、飞书 / Lark、企业微信、钉钉等 IM 前端。
典型用法:
python frontends/tgapp.py # Telegram
python frontends/wechatapp.py # 微信
python frontends/qqapp.py # QQ
python frontends/fsapp.py # 飞书 / Lark
python frontends/wecomapp.py # 企业微信
python frontends/dingtalkapp.py # 钉钉
详细配置请直接咨询 GenericAgent 本身。
通用聊天命令:
/new- 开始新对话并清空当前上下文/continue- 列出可恢复的对话快照/continue N- 恢复第N个可恢复对话
📊 与同类工具对比
| 特性 | GenericAgent | OpenClaw | Claude Code |
|---|---|---|---|
| 代码量 | ~3K 行 | ~530,000 行 | 已开源(体量大) |
| 部署 | pip install + API Key |
多服务编排 | CLI + 订阅 |
| 浏览器控制 | 真实浏览器(保留会话) | 沙箱 / 无头浏览器 | 通过 MCP 插件 |
| 操作系统控制 | 鼠标/键盘、视觉、ADB | 多 Agent 委派 | 文件 + 终端 |
| 自我进化 | 自主增长技能 | 插件生态 | 会话间无状态 |
| 开箱即用 | 几个核心文件 + 入门技能 | 数百个模块 | 丰富的 CLI 工具集 |
📈 评测 —— 五大维度
📂 完整评测数据集和结果:https://github.com/JinyiHan99/GA-Technical-Report/tree/main
| 维度 | 问题 | 使用的基准 |
|---|---|---|
| 1. 任务完成与 Token 效率 | GA 能否比主流 Agent 更经济地完成困难任务? | SOP-Bench, Lifelong AgentBench, RealFin-Benchmark |
| 2. 工具使用效率 | 最小原子工具集能否以更少开销完成专用工具集的任务? | Tool Efficiency Benchmark(11 个简单 + 5 个长期任务) |
| 3. 记忆系统有效性 | 精简分层记忆是否优于完整/冗余记忆和基于嵌入的检索器? | SOP-Bench(危险品)、LoCoMo、20-skill 压力测试 |
| 4. 自我进化能力 | Agent 能否无需干预地将经验提炼为可复用的 SOP 和代码? | 9 轮 LangChain 纵向研究、8 任务跨任务 Web 基准 |
| 5. 网页浏览能力 | 密度驱动的设计是否能在开放网页上存活? | WebCanvas、BrowseComp-ZH、自定义任务(22 个) |
这些维度的基线包括 Claude Code、OpenAI CodeX 和 OpenClaw,分别在 Claude Sonnet 4.6、Claude Opus 4.6、GPT-5.4 和 MiniMax M2.7 骨干模型上评估。
![]() 工具使用效率雷达图。GA 在 Token、请求数和工具调用轴上全面领先,同时在四个任务维度上保持质量。 |
![]() 跨任务自我进化。GA 在第二次和第三次运行时,八个 Web 任务都收敛到稳定的低成本区间,而 OpenClaw 没有表现出这种收敛。 |
🧠 工作机制
GenericAgent 通过分层记忆 × 最小工具集 × 自主执行循环完成复杂任务,并在执行过程中持续积累经验。
1️⃣ 分层记忆系统
记忆在任务执行过程中沉淀,让 Agent 逐步形成稳定高效的工作模式。
- L0 — 元规则:Agent 的核心行为规则和系统约束
- L1 — 记忆索引:用于快速路由和检索的极简记忆索引
- L2 — 全局事实:长期运行中积累的稳定知识
- L3 — 任务技能 / SOP:完成特定任务类型的可复用工作流程
- L4 — 会话归档:从已完成会话中提炼出的归档任务记录,用于长期回忆
2️⃣ 自主执行循环
感知环境状态 → 任务推理 → 执行工具 → 将经验写入记忆 → 循环
整个核心循环仅约 100 行代码(agent_loop.py)。
3️⃣ 最小工具集
GenericAgent 仅提供 9 个原子工具,构成与外部世界交互的基础能力。
| 工具 | 功能 |
|---|---|
code_run |
执行任意代码 |
file_read |
读取文件 |
file_write |
写入文件 |
file_patch |
补丁/修改文件 |
web_scan |
感知网页内容 |
web_execute_js |
控制浏览器行为 |
ask_user |
人机确认 |
此外,还有 2 个记忆管理工具(
update_working_checkpoint、start_long_term_update),允许 Agent 跨会话持久化上下文并积累经验。
4️⃣ 能力扩展机制
能够动态创建新工具。
通过 code_run,GenericAgent 可以在运行时动态安装 Python 包、编写新脚本、调用外部 API 或控制硬件——将临时能力固化为永久工具。
GenericAgent 工作流程图
⭐ 支持
如果这个项目对你有帮助,请考虑点一个 Star! 🙏
也欢迎加入我们的 GenericAgent 社区群 进行讨论、反馈和共建 👏
微信群 18![]() |
🚩 友情链接
感谢 LinuxDo 社区的支持!
社区 GUI 客户端(独立开源项目):
📄 许可协议
MIT 许可证 —— 详见 LICENSE
免责声明:本项目未构建或运营任何商业网站。除 DintalClaw 外,目前没有任何机构、组织或个人被正式授权以 GenericAgent 名义进行商业活动。
🌟 项目简介
GenericAgent 是一个极简、可自我进化的自主 Agent 框架。核心仅 ~3K 行代码,通过 9 个原子工具 + ~100 行 Agent Loop,赋予任意 LLM 对本地计算机的系统级控制能力,覆盖浏览器、终端、文件系统、键鼠输入、屏幕视觉及移动设备。
它的设计哲学是:不预设技能,靠进化获得能力。
每解决一个新任务,GenericAgent 就将执行路径自动固化为 Skill,供后续直接调用。使用时间越长,沉淀的技能越多,形成一棵完全属于你、从 3K 行种子代码生长出来的专属技能树。
🤖 自举实证 — 本仓库的一切,从安装 Git、
git init到每一条 commit message,均由 GenericAgent 自主完成。作者全程未打开过一次终端。
📋 核心特性
- 自我进化: 每次任务自动沉淀 Skill,能力随使用持续增长,形成专属技能树
- 极简架构: ~3K 行核心代码,Agent Loop 约百行,无复杂依赖,部署零负担
- 强执行力: 注入真实浏览器(保留登录态),9 个原子工具直接接管系统
- 高兼容性: 支持 Claude / Gemini / Kimi / MiniMax 等主流模型,跨平台运行
- 极致省 Token: 上下文窗口不到 30K,是其他 Agent(200K–1M)的零头。分层记忆让关键信息始终在场——噪声更少,幻觉更低,成功率反而更高,而成本低一个数量级。
🧬 自我进化机制
这是 GenericAgent 区别于其他 Agent 框架的根本所在。
[遇到新任务]-->[自主摸索](安装依赖、编写脚本、调试验证)-->
[将执行路径固化为 Skill]-->[写入记忆层]-->[下次同类任务直接调用]
| 你说的一句话 | Agent 第一次做了什么 | 之后每次 |
|---|---|---|
| "监控股票并提醒我" | 安装 mootdx → 构建选股流程 → 配置定时任务 → 保存 Skill | 一句话启动 |
| "用 Gmail 发这个文件" | 配置 OAuth → 编写发送脚本 → 保存 Skill | 直接可用 |
用几周后,你的 Agent 实例将拥有一套任何人都没有的专属技能树,全部从 3K 行种子代码中生长而来。
🎯 实例展示
| 🧋 外卖下单 | 📈 量化选股 |
|---|---|
![]() |
![]() |
| "Order me a milk tea" — 自动导航外卖 App,选品并完成结账 | "Find GEM stocks with EXPMA golden cross, turnover > 5%" — 量化条件筛股 |
| 🌐 自主网页探索 | 💰 支出追踪 |
![]() |
![]() |
| 自主浏览并定时汇总网页信息 | "查找近 3 个月超 ¥2K 的支出" — 通过 ADB 驱动支付宝 |
📅 最新动态
- 2026-05-15: 🖥️ 桌面 GUI 发布 —— 一键安装现在会自带可直接运行的桌面端(
frontends/GenericAgent.exe),开发者也可用python launch.pyw启动。 - 2026-05-14: 🆕 Conductor 子 Agent 编排 —— 派发、监督、自动清理并行子 Agent;与
/btw旁路子 Agent 互补,提供一等公民级的任务委派原语。 - 2026-05-12: 🆕 TUI v2 正式发布(
frontends/tuiapp_v2.py)—— 重做视觉风格的 Textual 前端,支持图片粘贴折叠、文件粘贴、块删除、Ctrl+C 复制、历史导航,以及/llm//export//continue选择器。 - 2026-04-21: 📄 技术报告已发布至 arXiv — GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization
- 2026-04-11: 引入 L4 会话归档记忆,并接入 scheduler cron 调度
- 2026-03-23: 支持个人微信接入作为 Bot 前端
- 2026-03-10: 发布百万级 Skill 库
- 2026-03-08: 发布以 GenericAgent 为核心的"政务龙虾" Dintal Claw
- 2026-03-01: GenericAgent 被机器之心报道
- 2026-01-16: GenericAgent V1.0 公开版本发布
🚀 快速开始
⚠️ Python 版本: 推荐使用 Python 3.11 或 3.12。请不要使用 Python 3.14,与
pywebview及部分依赖不兼容。
📖 详细安装指南:installation_zh.md(中文) · installation.md (English)
给 LLM Agent 看的
获取安装指南并照做:
curl -fsSL https://raw.githubusercontent.com/lsdefine/GenericAgent/refs/heads/main/docs/installation_zh.md
给人类用户看的
方法一:一键安装(推荐)
一键安装会自动准备独立 Python 环境、Git、项目文件和桌面端,不污染系统环境。
Windows PowerShell
powershell -ExecutionPolicy Bypass -c "irm http://fudankw.cn:9000/files/ga_install.ps1 | iex"
Linux / macOS
curl -fsSL http://fudankw.cn:9000/files/ga_install.sh | bash
安装完成后,双击启动:
frontends/GenericAgent.exe
方法二:Python 安装(开发者)
git clone https://github.com/lsdefine/GenericAgent.git
cd GenericAgent
uv venv
uv pip install -e ".[ui]" # 核心 + UI 依赖
cp mykey_template.py mykey.py # 填入你的 LLM API Key
python launch.pyw
GenericAgent 更推荐由 Agent 在使用中自举环境,而不是预先手动装完整依赖。
完整引导流程见 GETTING_STARTED.md。
📖 新手使用指南(图文版):飞书文档
📘 完整入门教程(Datawhale 出品):Hello GenericAgent · GitHub
🖥️ 前端启动方式
桌面端
一键安装自带桌面端,双击:
frontends/GenericAgent.exe
终端 UI
基于 Textual 的轻量键盘驱动界面。支持多会话并发、实时流式输出,有终端就能跑。
python frontends/tuiapp_v2.py
Windows 上 TUI 显示异常的排查思路:
textual版本太旧,先pip install -U textual;- PowerShell / cmd 自带终端对 Unicode 和键位的支持比较糟糕,Windows 上推荐用 Git Bash,体验明显更稳;
- 仍然显示异常时,可以让 GA 自己修一遍,参考 Prompt:
"我在 Windows 的 PowerShell / cmd / Git Bash 中使用
frontends/tuiapp_v2.py体验非常差,出现了一堆不兼容问题。请参考 Claude Code 在 Windows 终端的最佳配置,把所有字体和显示不兼容的问题修一遍。"
Streamlit UI
python launch.pyw
💬 Bot 接口(IM)
GenericAgent 支持 Telegram、微信、QQ、飞书 / Lark、企业微信、钉钉等 IM 前端。
常用启动方式:
python frontends/tgapp.py # Telegram
python frontends/wechatapp.py # 微信
python frontends/qqapp.py # QQ
python frontends/fsapp.py # 飞书 / Lark
python frontends/wecomapp.py # 企业微信
python frontends/dingtalkapp.py # 钉钉
详细配置直接问 GenericAgent。
通用聊天命令:
/new- 开启新对话并清空当前上下文/continue- 列出可恢复会话快照/continue N- 恢复第N个可恢复会话
📊 与同类产品对比
| 特性 | GenericAgent | OpenClaw | Claude Code |
|---|---|---|---|
| 代码量 | ~3K 行 | ~530,000 行 | 已开源(体量大) |
| 部署方式 | pip install + API Key |
多服务编排 | CLI + 订阅 |
| 浏览器控制 | 注入真实浏览器(保留登录态) | 沙箱 / 无头浏览器 | 通过 MCP 插件 |
| OS 控制 | 键鼠、视觉、ADB | 多 Agent 委派 | 文件 + 终端 |
| 自我进化 | 自主生长 Skill 和工具 | 插件生态 | 会话间无状态 |
| 出厂配置 | 几个核心文件 + 少量初始 Skills | 数百模块 | 丰富 CLI 工具集 |
📈 评测 — 五大维度
📂 完整的评测数据集以及评测结果见:https://github.com/JinyiHan99/GA-Technical-Report/tree/main
| 维度 | 核心问题 | 使用的基准 |
|---|---|---|
| 1. 任务完成度与 Token 效率 | GA 能否以更低成本完成高难度任务? | SOP-Bench、Lifelong AgentBench、RealFin-Benchmark |
| 2. 工具使用效率 | 最小原子工具集能否以更低开销替代专用工具集? | Tool Efficiency Benchmark |
| 3. 记忆系统有效性 | 精简分层记忆能否超越冗余记忆和基于 Embedding 的检索器? | SOP-Bench、LoCoMo、20-skill 压力测试 |






