今天小编(袁曼雁)要和大家分享的是新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练,欢迎阅读~
刚刚,DeepSeek 官方发布 DeepSeek-V3 模型更新技术报告。
V3 新版本在数学、代码类相关评测集成绩超过 GPT-4.5!
而且这只是通过改进后训练方法实现。
DeepSeek-V3-0324 和之前的 DeepSeek-V3使用同样的 base 模型。
打破了之前传言该版本 base 模型是 R2 的传言。
新版本参数量约为 660B,与此前网传的 685B 有所出入。
开源版本上下文长度为 128K(网页端、App 和 API 提供 64K 上下文)。
私有化部署时只需要更新 checkpoint 和 tokenizer_config.json(tool calls 相关变动)。
目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程式进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。
官方建议,此后非复杂推理任务使用 V3 新版本更好。
此外,官方还进一步展示了新版本在各个维度的能力。
前端开发
生成代码可用性更高,视觉效果也更好。
中文写作
相较于 R1 版有进一步优化,特别提升了中长篇的内容质量。
比如写一篇关于苏轼生平的散文:
中文搜索
联网情况下,V3 新版本的搜索输出内容也更详实准确、排版更清晰美观。
现在写一份 3000 字的市场报告也是 so easy(上下滑动查看完整内容):
此外,V3 新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。
今天白天不少网友也上手实测了诸多能力,比如做个小游戏:
该版本模型采用宽松的 MIT 开源協定。
且可直接部署在 M3 Ultra 的 Mac Studio 上。
这意味着大模型开发应用的门槛更进一步降低。
话不多说,趁着深夜,还没睡的赶紧去体验最新版吧 ~
参考链接: https://mp.weixin.qq.com/s/XK6ymJL7y0vo_GQXxmpuBA
关于新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练就分享完了,您有什么想法可以联系小编(袁曼雁)。