行业新闻

Together AI 上线 Thinking Machines Lab 多模态模型 Inkling

Inkling 是一个能灵活控制推理成本的多模态 MoE 模型,架构创新且已上线 Together AI,值得关注其效率与通用性。

Thinking Machines Lab 发布新模型 Inkling,它是一个多模态混合专家模型(MoE,即用多个专用子网络协同处理不同任务),支持文本、图像和音频输入并输出文本。其架构创新包括查询条件相对注意力、短因果卷积和共享专家路由,并支持可控推理深度,允许开发者根据任务调整算力消耗。Together AI 已在其推理平台上提供 Day 0 访问,通过 FlashAttention-4 内核优化推理效率。

正文摘录

Together AI 在 第 0 天 引入 Thinking Machines Lab 的新模型 Inklin 今天,Thinking Machines Lab 发布了 Inkling,一个全新的多模态混合专家模型,专为 token 高效推理、原生多模态理解和广泛任务通用性而设计。Together AI 很高兴与 Thinking Machines Lab 团队合作,让开发者可以在我们的推理平台上使用 Inkling。 Inkling 接受文本、图像和音频输入,并通过统一的解码器架构生成文本输出。它支持可控推理工作量,允许开发者根据每个任务的需求调整模型应用的推理深度。其后训练也涵盖了广泛的能力,包括科学推理、编码、智能体工作流、预测和校准预测。 在引擎盖下,Inkling 引入了多项超越传统纯解码器 Transformer 的架构创新,包括查询条件相对注意力、贯穿模型的短因果卷积,以及带有共享专家汇聚的混合专家架构。这些组件共同设计以支持强大的推理和多模态能力,同时保持高效的模型执行。大规模高效地服务它并非易事,而这正是 Together AI 推理栈所优化的负载类型,因此你可以在生产推理中实际获得模型的效率提升。在 Together AI 上,Inkling 使用优化的 [基于 FlashAttention-4 的注意力内核](https://www.together.ai/blog/flashattention-4) 运行,该内核专为在生产中高效支持其查询条件相对注意力机制而设计。 祝贺 Thinking Machines Lab 团队发布此模型。 Inkling 一览 - Token 高效、可控推理:开发者可调整推理工作量,以平衡不同工作负载的推理深度、token 使用和延迟。

阅读原文(together.ai)→

行业新闻2026-07-15原文

相关内容