学习
DeepSeek R1
DeepSeek R1-Zero 是一款基于纯强化学习训练的推理模型,无需监督微调即可实现高效推理。在 AIME 2024 竞赛中 Pass@1 分数达到 71.0%,展现强大逻辑与数学推理能力。支持长上下文处理,具备自我进化、多任务泛化等特性,并通过开源和蒸馏技术推动模型应用与优化。
南京大学人工智能学院
吕建院士领导的南京大学计算机软件新技术国家重点实验室2007、2012、2017 连续三次获评优秀,名列全国计算机领域第一
