Phi-4-reasoning-plus
Phi-4-reasoning-plus 是一个先进的开放权重推理模型,在 Phi-4 的基础上通过额外强化学习进行微调,以提高准确性。与 Phi-4-reasoning 一样,它通过合成数据和高质量公共数据的混合训练而成,侧重于数学、科学和编码,但平均生成多 50% 的 token 以提供更详细的响应。该模型拥有 14B 参数,并支持 128K token 的上下文长度。
输出包括一个推理思维链块和一个总结块。该静态模型根据截至2025年3月的数据训练而成,并根据 MIT 许可证发布。为获得最佳结果,请使用聊天格式的提示,并查阅许可证以了解详情。