行业新闻

DeepSeek R1技术创新解析:强化学习、Long CoT与开源生态影响

DeepSeek R1技术创新解析:强化学习、Long CoT与开源生态影响

三位研究者解析DeepSeek R1的RL、Long CoT和开源策略,揭示推理模型的创新本质。

嘉宾Xiang Yue、Jiayi Pan、Tiezhen Wang

节目简介

本期邀请三位一线研究者,从强化学习(RL,用奖励信号训练模型的范式)、Long CoT(长链思维,模型逐步推理的过程)和开源生态角度,深度拆解DeepSeek R1的技术突破与行业影响。

阅读原文(xiaoyuzhoufm.com)→

行业新闻2025-03-03原文

相关内容