grade school - 搜索 News

5 小时

近日，来自荷兰阿姆斯特丹的研究人员Raz成功以仅10美元的成本复现了DeepSeek中的‘顿悟时刻’，这一突破引发了广泛关注。这一成果不仅突破了以往高成本的限制，更为强化学习在小型计算资源环境中的应用提供了新的可能性。

11 小时

【新智元导读】不到10美元，3B模型就能复刻DeepSeek的顿悟时刻了？来自荷兰的开发者采用轻量级的RL算法Reinforce-Lite，把复刻成本降到了史上最低！同时，微软亚研院的一项工作，也受DeepSeek-R1启发，让7B模型涌现出了高级推 ...

1. 荷兰研究人员Raz成功将DeepSeek的顿悟时刻复刻到3B模型上，成本仅为10美元，刷新纪录。 2. 他采用轻量级强化学习算法Reinforce-Lite，消除了对替代目标比率和旧策略模型的需求。

一些您可能无法访问的结果已被隐去。

今日热点