DeepSeek V4.1 Flash跑分逼近美国顶尖模型 LiveBench差距缩至3%
|
10月5日北京时间消息,彭博行业研究指出,近几个月来,以DeepSeek为代表的中国AI实验室持续推出更先进的模型,导致美国AI企业相较中国同行的性能优势快速萎缩,已跌至有史以来的最低点,美国在科技领域的主导地位因此受到挑战。 彭博行业研究高级分析师罗伯特·利亚在周一发布的报告中指出,DeepSeek于9月推出V4.1 Flash后,中国最顶尖的模型在基准测试得分上与美国竞争对手的差距仅为3%。相比之下,这一差距在5月份约为9%,今年早些时候则达到15%。 利亚认为,中国竞争者性能的不断提升,预示着它们将进一步抢占市场份额。 彭博分析认为,中国模型技术的快速崛起,一方面源于其AI专业能力的持续积累,另一方面也得益于研究人员针对国产硬件对模型进行优化的能力。这些进展引发了外界对美国技术出口限制措施有效性的质疑。 利亚表示,中国所取得的进步“使人们进一步怀疑美国在AI领域的科技主导地位是否能够长期维系”。 上个月,DeepSeek的V4.1 Flash在LiveBench全球排名中位居第六,这是自这家创业公司2025年凭借推理模型R1实现突破以来,中国模型取得的最高排名。LiveBench通过对AI模型回答问题、解谜或完成任务的表现进行分析来打分,其过程类似于衡量人类智商。 DeepSeek最近一次在LiveBench上的得分为81.1分,而Anthropic的最高得分为83.4分。利亚指出,这表明DeepSeek模型的表现已经“能够与Anthropic和OpenAI的领先AI系统相匹敌”。不过,尽管双方得分差距已缩小至仅3%,LiveBench评出的前15个模型中,仅有3个来自中国。 利亚同时提醒,此类排名会随时间变化,而且不论模型在排行榜上名次如何,实现商业变现都可能面临困难。 |
论坛热帖
在线投稿
-
相关阅读
-
央媒发声三大球不翻身不行 亚运会表现引发深刻反思
-
郑钦文中网女单首盘抢七取胜 强势开启中国赛季
-
张本智和出征中国赛目标前二 盼与高手对决
-
郑钦文连续三场打满决胜盘 成功晋级中网32强
-
陈飞宇演反派入戏太深吓到父母 演技爆发获观众好评
-
老干妈用上AI了 营收创历史新高
-
老外来中国扫货顺便旅游 入境购物热潮兴起
-
缅北电诈回流人员亲述被割肾经历 偷渡者悲惨遭遇曝光
-
入驻商铺
-
精彩图片
-
医生提醒:哈兰德狂人食谱不适合普通人,别盲目模仿
-
严重污染!印度首都河面漂浮大量有毒泡沫
-
金饰价格突破800元/克大关
-
绝美!北京朝霞遇到平流雾
-
美国给以色列派先遣队,援助的“萨德”也将启用?
-
以总理住宅遭无人机袭击 以方反应强烈
-
美政府紧急调查以色列报复伊朗计划外泄事件
-
以军袭击加沙地带北部拜特拉希亚地区已致73人死亡
-
新帖速递
-
央媒发声三大球不翻身不行 亚运会表现引发深刻反思
-
郑钦文中网女单首盘抢七取胜 强势开启中国赛季
-
张本智和出征中国赛目标前二 盼与高手对决
-
郑钦文连续三场打满决胜盘 成功晋级中网32强
-
陈飞宇演反派入戏太深吓到父母 演技爆发获观众好评
-
老干妈用上AI了 营收创历史新高
-
老外来中国扫货顺便旅游 入境购物热潮兴起
-
缅北电诈回流人员亲述被割肾经历 偷渡者悲惨遭遇曝光

精彩评论文明上网理性发言,请遵守评论服务协议
共0条评论