Mythos Preview可自主完成工程任务,代码审查表现优异
引用:
'我们发现的一个核心行为转变是,Mythos Preview 可以接受一个工程目标并自主完成整个周期:调研、实现、测试和报告结果。在长时间代理会话中,它保持专注,派出子代理并行研究,并在等待后台工作完成时选择返回人类用户,而不是停止。早期测试者描述说,能够“首次在多个小时的任务上设置并遗忘”。
例如,一位测试者发现它在不受支持的环境中通过从不同发行版下载二进制文件并打补丁来运行,从而引导了一个工具链。与模型的交互需要更少的引导,更加自主:“描述任务规范以及如何验证进度,然后稍后再回来。”'
'在代码审查中,Mythos Preview 更像一位资深工程师。它倾向于捕捉甚至极其微妙的错误,并识别根本原因和错误存在的原因,而不仅仅是症状。测试者看到它发现了其他有能力的模型忽略的问题,然后诊断并修复问题,而不仅仅是标记它。那些在人工审查模型生成代码时常见的简单捕获问题要少得多。
'我们发现的一个核心行为转变是,Mythos Preview 可以接受一个工程目标并自主完成整个周期:调研、实现、测试和报告结果。在长时间代理会话中,它保持专注,派出子代理并行研究,并在等待后台工作完成时选择返回人类用户,而不是停止。早期测试者描述说,能够“首次在多个小时的任务上设置并遗忘”。
例如,一位测试者发现它在不受支持的环境中通过从不同发行版下载二进制文件并打补丁来运行,从而引导了一个工具链。与模型的交互需要更少的引导,更加自主:“描述任务规范以及如何验证进度,然后稍后再回来。”'
'在代码审查中,Mythos Preview 更像一位资深工程师。它倾向于捕捉甚至极其微妙的错误,并识别根本原因和错误存在的原因,而不仅仅是症状。测试者看到它发现了其他有能力的模型忽略的问题,然后诊断并修复问题,而不仅仅是标记它。那些在人工审查模型生成代码时常见的简单捕获问题要少得多。