部署基于微调LLM的象棋引擎,目标达2000+ Elo
刚刚部署了一个新的国际象棋引擎;我们正在接近估计的1200 Elo。目标是让它达到2000+,同时保持约束:1. 一个小的微调LLM(没有自定义预训练或架构)2. 模型必须自己产生走法,没有国际象棋引擎辅助。如果放宽这些约束,就会容易得多。
如果你想玩我的国际象棋引擎(WIP):https://t.co/4WJ9SYmr1o 它似乎在国际象棋上已经表现优于前沿模型。它是在200万个Stockfish标注的位置上微调的,然后进行了短GRPO RL pass。包含所有实验和注释代码的文档/教程。