返回顶部
热门问答 更多热门问答
技术文章 更多技术文章

DeepSeek 新模型上线:6850亿参数的 DeepSeek-V3 再进化!

[复制链接]
链载Ai 显示全部楼层 发表于 9 小时前 |阅读模式 打印 上一主题 下一主题

DeepSeek 终于发布新模型了!

3 月 24 日晚,DeepSeek 在官方 Hugging Face 社区上传了一个名为DeepSeek-V3-0324的新模型。

顾名思义,DeepSeek 的这个新模型是上一代DeepSeek-V3的升级版本。

点击进入DeepSeek-V3-0324的模型页面,虽然 DeepSeek 官方还没有来得及上传详细的 README 文档,但从右边的模型参数信息也能够推断出蛛丝马迹。

新模型的参数量为 685B,即 6850 亿个参数。这个参数量与上一代DeepSeek-V3是一样的。

而新模型所支持的张量数据类型也和前代模型保持一致:支持 BF16、F8_E4M3 和 F32 三种不同精度的浮点数格式进行推理和训练计算。

毫无疑问,将开源进行到底的 DeepSeek 这次推出的DeepSeek-V3-0324也是完全开源的模型。

虽然 DeepSeek 官方还没有介绍,但不难推测,这次的DeepSeek-V3-0324主要会在两方面提升。

一个是性能。前一代的DeepSeek-V3说实话就挺强的,我微信公众号目前接入的就是DeepSeek-V3模型。

并且我也在DeepSeek-V3刚发布时就做了测试:测试完DeepSeek V3和GPT-4o,我不想再开ChatGPT会员了!这个测评文章发布于 DeepSeek 爆火之前,当时还有不少小可爱质疑DeepSeek-V3的能力。

其二是修 bug。是的,你没有看错,模型也是有 bug 的。之前的DeepSeek-V3有一个很“致命”的问题:function call 循环调用和空回复。

这是 DeepSeek 官方之前在其开放平台发的公告。而现在,这句话已经没有了。

至于在哪里使用DeepSeek-V3-0324,DeepSeek 官方还没有明确说。但 Hugging Face 已经有小伙伴表示官网 “非深度思考” 模式下的底层模型已经换成了DeepSeek-V3-0324

其实也不用急,DeepSeek-V3-0324一旦正式发布,DeepSeek 官网和 API 都会同步更新。

    回复

    使用道具 举报

    您需要登录后才可以回帖 登录 | 立即注册

    本版积分规则

    链载AI是专业的生成式人工智能教程平台。提供Stable Diffusion、Midjourney AI绘画教程,Suno AI音乐生成指南,以及Runway、Pika等AI视频制作与动画生成实战案例。从提示词编写到参数调整,手把手助您从入门到精通。
    • 官方手机版

    • 微信公众号

    • 商务合作

    • Powered by Discuz! X3.5 | Copyright © 2025-2025. | 链载Ai
    • 桂ICP备2024021734号 | 营业执照 | |广西笔趣文化传媒有限公司|| QQ