搜索文章
Ministral 3:小模型不需要 36 万亿 token,蒸馏才是正道
2026年1月16日
Mistral 用级联蒸馏把 24B 模型压到 3B,只用了别人十分之一的数据。这条路走通了吗?
DeepSeek R1 论文解读:强化学习如何自主激发推理能力
2025年1月15日
分析 DeepSeek R1 论文的核心创新,包括 RL 推理、GRPO 算法和模型蒸馏。
DeepSeek-V3 技术报告解读:省钱与高性能的极致平衡
2024年12月30日
分析 DeepSeek-V3 的低成本训练策略、架构创新和工程优化。