AI热点 1月前 146 阅读 0 评论

初探 Deepseek R1-0528 开源模型:AI 编程能力跃升,媲美 OpenAI o3 和 o4-mini

作者头像

AI技术专栏作家 | 发布了 246 篇文章

IT之家 5 月 29 日消息,深度求索(Deepseek)昨日通过官方交流群,邀请用户测试 DeepSeek-R1-0528 模型小版本,初步测试结果表明,R1-0528 在编程能力、审美设计和代码补全等方面表现出色,尤其在复杂指令处理和前端页面生成上展现了高精度和高效能。

DeepSeek-R1-0528 模型在多个方面实现了性能提升,其中最为亮眼的就是编程能力,能根据用户输入的简单提示词,快速生成高质量代码。

代码测试平台 Live CodeBench 中显示,其性能可以媲美 OpenAI 最新的 o3 模型(High)。

在 Extended NYT Connections 跑分中,DeepSeek-R1-0528 模型跑分为 49.8 分,而初代 Deepseek R1 模型为 38.6 分。

IT之家注:Extended NYT Connections 是一个用于评估大型语言模型(LLM)性能的基准测试,基于《纽约时报》的 Connections 谜题游戏。

这个基准测试包含了 651 个 NYT Connections 谜题,并且增加了额外的词汇以提高难度,旨在更全面地测试模型的语言理解和推理能力。

R1-05-28 具有 o3-2.5 专业风格的响应。箭头 / 星号的使用与 o3 风格非常一致,结尾处“why it works”的表述更具说服力。

此外,在审美设计和代码补全(code completion)方面,R1-0528 同样表现卓越。测试中,该模型轻松应对多样化任务,输出结果精准且实用。

在生成复杂前端页面和动态动画方面,R1-0528 也展现了强大的能力,能准确理解复杂指令。更重要的是,相比较 OpenAI 的 o3 和 o4-mini 模型,R1-0528 大幅缩短了推理时长,提供了更加流畅和高效的使用体验。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。

作者头像

AI前线

专注人工智能前沿技术报道,深入解析AI发展趋势与应用场景

246篇文章 1.2M阅读 56.3k粉丝

评论 (128)

用户头像

AI爱好者

2小时前

这个更新太令人期待了!视频分析功能将极大扩展AI的应用场景,特别是在教育和内容创作领域。

用户头像

开发者小明

昨天

有没有人测试过新的API响应速度?我们正在开发一个实时视频分析应用,非常关注性能表现。

作者头像

AI前线 作者

12小时前

我们测试的平均响应时间在300ms左右,比上一代快了很多,适合实时应用场景。

用户头像

科技观察家

3天前

GPT-4的视频处理能力已经接近专业级水平,这可能会对内容审核、视频编辑等行业产生颠覆性影响。期待看到更多创新应用!