行业新闻

法国初创公司 Kog 深挖 GPU 推理潜力

一家法国初创公司试图用软件优化榨干现有 GPU 的推理性能,已获关注,但还需在大模型上证明自己。

AI 推理(模型生成回答的过程)速度成为行业瓶颈。法国初创公司 Kog 通过深入 GPU 底层优化,在现有数据中心 GPU 上实现每秒 3000 tokens 的解码速度,已吸引 200 条商业线索,下一步将在更大模型上验证其方法。

正文摘录

Kog 决定向更深处挖掘 GPU 的推理潜力 更快的 [AI 推理](https://techcrunch.com/2026/07/03/artificial-intelligence-definition-glossary-hallucinations-guide-to-common-ai-terms/inference) 竞赛已经打响,市场在 5 月的 IPO 首秀中给予 Cerebras 及其定制芯片 [热烈欢迎](https://techcrunch.com/2026/05/14/cerebras-raises-5-5b-kicking-off-2026s-ipo-season-with-a-bang/)。但法国初创公司 [Kog](https://www.kog.ai/) 押注的是:传统 GPU 中还有更多性能可以被榨取。 这家初创公司在 5 月凭借一项 [技术预览](https://blog.kog.ai/real-time-llm-inference-on-standard-gpus-3-000-tokens-s-per-request/) [登上了 Hacker News 首页](https://news.ycombinator.com/item?id=48321076),旨在证明“在企业已经拥有的标准数据中心 GPU 上实现极快的单请求解码是可能的”——其演示使用的是 AMD MI300X 和 Nvidia H200 GPU。 有人对这项技术无法扩展到笔记本电脑 GPU 感到失望,但也有人看到了其中的潜力。随着推理速度和成本成为关键瓶颈,Kog 承诺通过软件优化在现有硬件上解锁新能力,吸引了 [不止是围观者](https://x.com/KogAI/status/2062870822004387897)。

阅读原文(techcrunch.com)→

行业新闻Anna Heim2026-08-14原文

相关内容