热门产品

PenguinHarness

PenguinHarness

开源智能体自改进框架,允许开发者用极低成本自主构建、评估和优化AI代理,支持多模型与复用技能。

热门评论

PH 用户
Hey Product Hunt 👋

我们是 LlamaFactory 背后的团队,今天正式发布 PenguinHarness——一个开源、能自我进化的 harness,我们花了过去六个月来构建它。

大多数智能体框架都是为人类设计的,需要手动连接 prompt、工具和工作流。我们想做点不一样的:一个专为智能体本身设计的 harness。

有了 PenguinHarness,智能体可以构建其他智能体、生成评估数据、分析失败原因、优化 Skills 和工作流、运行回归测试,并保留成功的改进——形成一个完整的自我改进闭环。

今天发布的内容包括:

🐧 AI 原生的智能体运行时
🔌 统一接入 1,000+ 模型
🧰 工具执行与上下文/状态管理
🧠 可复用且可优化的 Skills
📊 自动数据生成与多智能体评估
🔁 闭环 harness 进化
🏠 完全开源、可自托管

在一次实验中,一个智能体仅凭一条 prompt 就构建了一个完整的 RAG 应用,花费大约 $0.02。

在我们复杂的数据分析基准测试中,PenguinHarness + DeepSeek 在所有测试配置里取得了最高精度,成本大约是 Claude Code + Opus 的 1/70。

我们非常希望听到你对智能体面向的 SDK、自我改进工作流以及接下来应该支持哪些模型或集成的反馈。

感谢你来看看 PenguinHarness 🐧

https://penguin.ooo/
PH 用户
封闭循环进化这部分是我最想先做压力测试的。让智能体构建其他智能体、自己生成评估数据、然后保留评分高的改进——这听起来不错,但如果评估数据本身已经带有了智能体自认为“好”的偏见,那就有风险。如果提议修改的系统同时也在给这些修改打分,那么它很可能会优化那些能让自己在自家基准上拿高分的东西,而不是真正在实际中更好用的东西。

当被评估的对象也参与了测试数据的生成,你怎么确保评估是诚实的?另外,那个 $0.02 的 RAG 应用数字是个有趣的口号,但我想知道那次运行到底包含了什么。它有没有包含重试、被丢弃的失败尝试,还是仅仅算了一次成功的通过?很多智能体的成本数字都悄悄忽略了在成功之前进行的探索。
热门产品Yaowei Zheng2026-07-23原文

相关内容