纯血国产!4B模型越级打怪,杀入万亿赛道

浏览14次 点赞0次 收藏0次

就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。

事情是这样的。

9月1日,Hugging Face上线了两个开源端侧模型:星火X2.5-4B和1.7B

本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两圈的对手,狠狠地秀了一把肌肉。


  • 比如考验多轮工具调用的τ³-bench,拿了30.4分。这测的是极限定力,几十步操作连轴转,中间只要错一步,整个任务直接拉胯。

  • 测试MCP协议的MCP-Atlas,拿下54.6分。把它丢进真实的API环境里,它给接口填的参数严丝合缝,一点报错的空子都不钻。

  • 自主上网搜信息的BrowseComp,跑到40.9分。哪怕网页里一堆弹窗和垃圾代码,它照样能像活人一样,把有效数据生抠出来。

  • 至于专考「听人话」的IFBench,更是飙到了75.0分。面对那种字数超长、格式层层叠加的变态指令,它硬是做到了一丝不差。

在考察智能体(Agent)、工具调用和真实任务完成率这几项硬指标上,更是实现了「越级打怪」。

1.7B版本也不含糊。在考察MCP工具使用的MCP-Atlas里,它拿了23.4分,同尺寸这一档里最高。

光看数字没意思,我们第一时间把它下下来跑了跑。

装进本地环境后,直接下指令:写一个霓虹烟花的HTML页面。代码出得极其利落,一口气吐完,中间不带卡壳的。


跑出来的效果确实惊艳。

鼠标点哪儿哪儿炸,一簇七十多颗粒子四散开来,同一朵烟花颜色高度统一,粉的、青的、橘的随机切换——烟花的物理动态和氛围感,一下就出来了。


值得一提的是,这两款模型从头到尾都基于全国产算力平台完成训练,部署端更是打通了英伟达、、海光及后摩等主流硬件平台。

做这件事的,是科大讯飞全资子公司「词元星火」。

端侧AI

跨越「好用」门槛

过去这两年,大模型的故事几乎全发生在云端。参数越堆越庞大,离真实用户却越来越远。想用?必须先联网,还得把数据乖乖交出去。

可现实中偏偏有一大批机器「碰不到云」。比如内网里的办公电脑、工厂车间里的终端设备。

这些无网场景当然也有人试过水,办法无非两种。

要么,硬往本地塞几十、上百B的开源大模型,结果对硬件要求极高,部署折腾半天,跑起来还像看幻灯片; 要么,退而求其次用个小尺寸模型。

可过去的小模型,能力大多停留在「陪聊」和「文字续写」。你把一叠报表扔给它说「帮我整理一下」,它大概率会一本正经地给你回复一段「整理建议」。

端侧模型的尴尬一直卡在这儿。它只会动嘴,动不了手。

而用户的诉求其实特别朴素:几十页的操作手册能不能一次性读完?一个需要多步操作的复杂任务能不能直接帮我干完?

星火X2.5这两个模型,冲的就是这件事。

要干脏活累活,第一步是得先「挤得进」那台机器。

在BF16精度下,4B模型的权重只占8个多G,1.7B模型只要3个多G。如果做一下4bit量化,体积还能再砍一半。

尺寸压到这份上,它的使用场景就非常清晰了。

  • 4B模型直接进笔记本和工作站,哪怕是塞进一套正在运行的老旧业务系统里也毫无压力;

  • 1.7B模型则专攻汽车座舱、智能家居等,一台普通手机就能轻松带飞。


实测

断网生啃两份八千字合同

为了探探它的底,我们把它接进Codex,丢给它两份八千多字的商业合同,要求它找出所有的改动痕迹。

从结果来看,它找出的其中三处暗雷,说实话,连我们自己用肉眼看都未必能挑得出来。


  • 「应当」被改成了「可以」。就这两个字的差别,强制义务瞬间变成了任意条款。人类审阅时,眼睛一扫极容易滑过去。

  • 「知识产权」条款整段消失。B版合同里关于衍生成果归属的那段根本不存在,它是顺着条款编号递进的逻辑硬揪出来的。找一个「不存在」的东西,远比找一个「被修改」的东西要难得多。

  • 违约金条款,它竟然着看了。乙方违约金从万分之五降到了万分之三,甲方却没动,两条原本对等的条款现在不对等了。这种相隔好几行的内容,必须具备全局记忆力才能比对得出来。

除此之外,它还严谨地逐条列出了A版原文、B版原文、对我方的影响以及风险等级,最后按高、中、低风险分档汇总,并附上了五条应对建议。这套东西拿到手,基本上可以直接转发给法务,连返工都省了。

审完文本合同,紧接着是更硬核的数据处理。

我们丢给它一张未经处理的原始表格。结果它自己写了段Python代码,自己跑通,自己生成了分析报告。


从理解需求、写脚本、执行到检查结果,全程零插手。它不是在给你提供「建议」,而是真刀真枪地自己动手,把文件盘了出来。

抓异常的眼光,更是极其毒辣。

单笔超5000审批上限的4条、字段缺失的3条、有拆单嫌疑的11条,被它揪得一清二楚。

连带周末报销、负数金额、小数位异常、工号姓名不匹配、甚至日期格式混乱这种恶心人的暗病,全被它挨个高亮标出。


最关键的是,交付的报告格式严丝合缝,打开就能直接用,彻底免去了人工二次排版的折磨。

对于财务、审计、法务这些天天跟敏感数据死磕的岗位来说,这才是决定AI到底「能不能用」的绝对分水岭。

而且别忘了,这一切全部是在一台断网的笔记本上完成的,合同数据连一个字节都没有离开过这台机器。

它究竟是怎么做到的?

为了让端侧小身板爆发出这种越级的智能体能力,词元星火在底层和后训练阶段,砸出了两套绝活。

第一招:混合注意力机制,把显存抠到极致。

要干复杂的活,首先得「看得全」。

星火X2.5不仅原生支持最长100万Token的上下文,还在底层架构上动了刀,极其聪明地把注意力层一分为二。

一层负责通读全文建立宏观联系,另一层则死抠眼前的局部细节。

这样既能看得足够远,又不需要在每一层都把算力拉满。

而省下来的,全是端侧最宝贵的显存。同样跑满100万Token,它占用的显存只有传统全局注意力模型的四分之一。

端侧模型记性差、长文本前言不搭后语的老毛病,就这么被治好了。

第二招:多教师在线策略蒸馏(MOPD),不教答案只教「走法」。

看全了之后,还得「会干活」。

为了把复杂的动作逻辑塞进4B的参数里,研发团队打出了一套叫MOPD的组合拳。

首先,用高质量数据打底,再按编程、推理、工具调用分科开小灶,练出一批在垂直领域登峰造极的「单科专家」大模型。

接下来就是核心环节——用这些老师傅去带徒弟。

传统蒸馏往往是老师给出标准答案,小模型照着死记硬背。但小身板的脑容量摆在这,硬知识装不下就是装不下。

而MOPD玩的,是更硬核的「在线策略」。

简单来说就是,小模型先自己上手去盘这道题,老师傅则在旁边全程督战,一步步纠正路线。读需求、挑工具、填参数、查报错,失败了换条路再来。

相比于硬塞知识的老路,它能把「遇到问题怎么解」这套动作机制,直接传给小模型。

千万台国产设备

在等一个能跑的模型

跑分和性能只是第一关。真正决定AI能不能大规模落地的,是它能不能顺畅地活在真实的行业设备里。

按照国资委79号文给出的时间表,到2027年底前后,央企国企必须完成信息化系统的信创替代——芯片、操作系统、中间件、基础软件,要求100%替换。

这背后是一个巨大的市场。

据券商测算,政企信创的市场空间动辄在数千亿乃至万亿级别。单单是党政口径,2025到2027年间的PC替换需求就在千万台量级

而2026和2027,就是集中交付的关键节点。

再加上今年8月施行的《网络数据安全风险评估办法》明确规定,采用AI大模型等新技术必须纳入动态安全评估。于是,「这份数据要不要发给云端大模型处理」已经不是成本问题,而是合规红线问题。

这些机器嗷嗷待哺的,正是一个能在国产芯片上跑、不需要联网、尺寸又足够小能塞进存量硬件里的模型。

星火X2.5的出现,几乎是严丝合缝地对上了这个缺口:

  • 算力自主:国产算力上训出来,国产硬件上跑得动。

  • 兼容性强:框架侧兼容vLLM、SGLang、llama.cpp,放在Ollama和LM Studio里几分钟就能跑起来。

  • 极致开源:权重采用Apache-2.0协议,不仅免费商用,微调后也无需开源。想做垂直场景的,拿LLaMA-Factory跑自己的数据就行。

目前,模型的权重、代码仓库和部署文档都已经毫无保留地在Hugging Face、ModelScope和GitHub上开放,API也同步上线了MaaS平台,限时免费。

Hugging Face地址:

https://huggingface.co/collections/XHToken/spark-x25

Github地址:

https://github.com/XHToken/Spark-X2.5

ModelScope地址:

https://www.modelscope.cn/collections/XHToken/Spark-X25

MaaS平台接入:

https://maas.xfyun.cn/modelSquare

在国内,「AI落地」往往被看作一个纯粹的应用题,大家都在卷谁的助手更好用,谁的Agent更花哨。

但那千万台在物理上隔绝的机器,面对的却是一道严酷的生存题。

它们连不上云,它们必须先拥有一个「装得进去、且真能干活」的引擎,然后才有资格谈好不好用。

而这道题也不止摆在办公电脑面前。路上跑的车机、客厅里的音箱、产线上的机器人,处境是一样的。网络时断时续,算力就那么点,活还得当场干完。

它们要的不是一个琴棋书画样样精通的全才。把手头那份操作手册读完,把那张表理顺,把那条指令一次执行对,就够了。

过去我们在评测时总爱问,这个模型有多聪明?但从现在开始,整个行业更该问的是,这个模型,能适配多少台设备?

最后,再来一个彩蛋。

9月7日,科大讯飞还将正式发布全新一代旗舰通用大模型——星火X2.5。届时,其代码与智能体等核心能力,将迎来又一次全面进化。

编辑:所罗门 摩西

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯