颠覆认知!小模型反杀大模型,DeepSeek Flash上演离谱逆袭
文章目录
- 1. 先唠唠最近AI圈的离谱大瓜
- 1.1 俩模型本来的人设很清晰
- 1.2 反转来得比偶像剧还快
- 2. 凭啥小个头能打赢大块头
- 2.1 最离谱的是:底子半毛钱没变
- 2.2 后训练的效果到底有多夸张
- 2.3 为啥这招对智能体这么好使
- 3. 难道大参数就彻底没用了?
- 3.1 Pro依然稳赢的几个场子
- 3.2 本质就是个时间差
- 4. 最后说两句实在的
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/qq_34419312
1. 先唠唠最近AI圈的离谱大瓜
1.1 俩模型本来的人设很清晰
今年四月DeepSeek出了V4系列,两款都是混合专家架构。
一款叫Pro,1.6T总参数、49B激活,明摆着是旗舰大哥。
另一款叫Flash,284B总参数、13B激活,主打高性价比走量。
搁以前这剧情不用想,大哥全方位碾压弟弟,天经地义。
就像买手机看Pro和青春版,闭着眼都知道谁更强。
1.2 反转来得比偶像剧还快
结果七月底Flash更了个0731正式版,直接把所有人看傻了。
9项智能体相关的基准测试,新版Flash全面超过了Pro预览版。
价格还只有Pro的三分之一。
相当于你买了台千元机,跑分直接打平自家万元旗舰。
搁谁不得揉三遍眼睛,以为自己看反了名次。
2. 凭啥小个头能打赢大块头
2.1 最离谱的是:底子半毛钱没变
说出来你可能不信,新版Flash和旧版Flash,架构、参数规模完全一样。
既没加专家数,也没涨参数量,就做了个“重新后训练”。
人还是那个人,脑子还是那个脑子,就是暑假补了个课。
补完成绩直接坐火箭,搁学校里得被老师怀疑抄答案。
2.2 后训练的效果到底有多夸张
给大家报几个数感受一下。
DeepSWE测试,从7.3干到54.4,直接涨了6倍多。
Cybergym分数翻倍,DSBench-Hard也涨了一倍还多。
就算提升最少的项目,也涨了三成多。
别家模型升级是挤牙膏,一次涨几个点就敢吹半年。
DeepSeek这波是直接把牙膏管扔了,往你脸上怼牙膏。
2.3 为啥这招对智能体这么好使
智能体任务和普通聊天不一样,不是光会接话就行。
要会调用工具,要懂多步推理,错了还得会自己圆回来。
这些本事,预训练的时候基本学不着。
就像你背了十年字典,不代表你会写代码。
后训练就是专门喂这类实操轨迹数据,喂多了自然就开窍了。
说白了就是针对性刷题,提分当然快。
3. 难道大参数就彻底没用了?
3.1 Pro依然稳赢的几个场子
先别急着喊“大参数已死”,Pro也不是全输了。
事实知识问答,Pro领先二十多分,优势巨大。
百万级长上下文检索,Pro的表现也更稳。
特别复杂的深度推理,Pro的上限还是更高。
毕竟块头在那摆着,装的知识多,底子厚。
就像偏科学霸,实操课翻车,但考知识点照样拿第一。
3.2 本质就是个时间差
说穿了很简单:Flash更了新的后训练,Pro还没更。
一个补过课刷过题,一个还停留在开学摸底考的水平。
不是大参数没用,是大参数没来得及点智能体这个技能点。
等Pro后续也补上这套后训练,该赢的地方还是能赢回来。
4. 最后说两句实在的
以前大家聊模型,张口闭口就是参数量,觉得越大越牛。
这事儿之后,这话得改改了。
参数规模是底子,但训练质量才是真正的战斗力。
堆硬件堆参数谁都会,把现有潜力挖透才是真本事。
以后选模型,别光看参数表吹牛皮。
先看看你要干啥活,再看看模型有没有针对性练过。
毕竟适合的,才是最好的。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/qq_34419312
