Together AI 于 ICML 2026 发布八篇全栈研究,从 Agent 到 GPU 内核
Together AI 八篇 ICML 论文覆盖 AI 全栈,强调层间协同,其中自适应推测解码已落地生产,体现研究下沉的完整循环。
Together AI 在 ICML 2026 展示八篇论文,覆盖从 Agent 到底层 GPU 内核的全栈研究。核心观点:前沿 AI 不能单层突破,各层必须协同迭代。例如自适应推测解码算法 Aurora 已部署为生产级 ATLAS speculator,加速推理。研究来自不同层级,但彼此依赖,共同构成平台能力。
正文摘录
Together AI 在 ICML 2026:全栈前沿研究 - title:Together AI 在 ICML 2026:全栈前沿研究 - sourcecompany:Together AI - bodymarkdown:  八篇论文光列出来就很多了。更好的阅读方式是看它们在栈中的位置。前沿 AI 并非在一个单层上构建,它是从 Agent 到 GPU kernel 的全栈研究的产物,而如果相邻层跟不上,任何单层的收益都会被浪费。 这是我们工作的核心。从顶层的 Agent 到底层的 kernel,我们的研究触及每一层,每层都为下一层提供输入。研究成果成为 Together 平台的一部分,而平台上运行的生产负载又指引我们找到下一个研究问题。Aurora,我们在 ICML 上关于自适应推测解码的研究,就是一个清晰的例子:同一项工作目前已经作为我们的 ATLAS 推测器在生产环境中上线。 以下是今年的工作,按层划分,自上而下。 01 前沿 Agent 能做实际工作的 Agent——用无法蒙混过关的任务来评估。 DSGym 10+ 领域,1000+ 任务 ThunderAgent Agent 推理速度最高提升 3.6 倍 TTT-Discover 超越最佳人类及开源模型 02 模型塑造 将基座模型变成推理者——即使在没有标准答案的情况下。 RARO 25% 胜率,无需验证器 V1 正确答案数最多提升 10% 03 算法优化 降低每个 token 的成本——能够适应实时流量的推测解码。