鹭羽发自凹非寺
量子位 | 公众号 QbitAI
不得了!国产大模型第一梯队,最近爆了个冷门。
一家新公司,首款模型只有 27B,却在信通院 MCP 专项测试中拿下综合第二。
排在它前面的,是梁文锋藏了近一年的大杀器——参数量高达 1.6 万亿的 DeepSeek-V4-Pro。
两者差距,只区区 1. 3 个百分点。

这匹黑马就是StartLux-V1.0-27B-Preview,来自 StartLux(原点星辉)。
有点面生是吧?别急,它的创始人兼 CEO 可是老熟人:陈大年。
AKA 互联网时期的初代程序员「教父」,战绩可查:
盛大网络联合创始人、连尚网络掌门人,中国最早引入“共享软件”概念的编程者……

退隐十年再度归来,这一次,他把赌注押在了本地模型上。
这就不得不提陈大年最近一次的罕见露面。
他在盛大创新院 18 周年老友聚会上公开喊话,“AI 时代有八条非共识”,其中四条都在强调本地模型。
本地模型会完全摧毁云端市场,3 年时间打平 Claude,占据 80% 的市场。模型拼参数的玩法要 OUT 了……
StartLux 就是他理念的最好展现。
公司业务没随行业大流,专注小而美的本地模型商业化,它也是全球第一家真正意义上的本地模型公司。

而作为第一张面向市场的成绩单,StartLux-V1.0-27B-Preview 不依赖云端,可直接运行在消费级 PC上。
也就是说,这个小了近 60 倍的本地模型,Agent 能力却能够追平万亿级云端旗舰。
凭什么?
27B 对上 1.6T,小模型打出大结果
在谜底揭晓之前,咱们不妨先来看看这次对标的是谁。
常言道,没人会记得第二名,除非第一是DeepSeek。
更何况,差距只有毫厘之间,非常值得说道说道。
成绩出自权威机构,中国信通院的可信 AI 大模型基准测试MCP 专项,其围绕真实应用场景设置六类任务:
位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D 设计。
再加一项综合评估,重点考察 Agent 多工具协同、复杂任务执行和真实环境交互。
简单来说,MCP-Universe 不看模型回答得好不好,看的是事情究竟能不能做出来。这也是判断 Agent 好坏最本质的地方。

结果显示,StartLux-V1.0-27B-Preview 综合得分 39.25%,排名第二。
超过 284B 参数的 DeepSeek-V4-Flash-0731 和 198B 的 Step-3.7-Flash,仅落后 DeepSeek-V4-Pro 1.3 个百分点。
同为 27B 参数规模,StartLux 也比 Qwen 3.6 要高出 5.34 个百分点。

单项成绩也很能打,位置导航、金融分析和浏览器自动化均位列第一,其余细分项也同样名列前茅。

除去数据,咱们再来看两场实战。
第一道题,是一笔跨越两年的微软股票投资,同题 PK 的是Claude Sonnet 4.6。
Prompt:如果在 2023 年 1 月 9 日往微软投入 25000 美元,一直持有到 2025 年 1 月 8 日收盘,最终价值和总收益率分别是多少?
Claude的答案是:47254 美元、89.02%。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg
StartLux则给出:47499.09 美元、90.00%。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg
看起来似乎差不多?但金融行业差之毫厘失之千里。
仔细看两个模型的思考过程,由于原始数据缺失,Claude Sonnet 4.6 直接把 2025 年 1 月 8 日误判为非交易日,计算的是前一天的收盘价。
同样的情况下,StartLux 分别回查当初数据,再验证目标日期附近的行情,确认准确收盘价后,才完成计算并生成可视化。
最终 StartLux 得出的结论才是正确的、可复核可追溯的。
第二道题则更直观,让两个模型同时帮忙在浏览器上查询机票。
Prompt:浏览器打开 Google Flights,找一班从新加坡飞北京的单程航班,5 天后出发,我要最便宜的直飞经济舱,而且不要落在大兴机场。只看价格,任务结束后关闭浏览器。
其中,StartLux-V1.0-27B-Preview 用时约 95 秒完成搜索,找到了价格为 299 美元的国航机票。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg
反观 Claude Sonnet 4.6 在日期选择、弹窗关闭和筛选菜单之间经历了更多截图确认,还一度误触时间筛选面板。
两百多秒后,它给出的最低报价是 556 美元。价格更高,搜索时间还是 StartLux 的两倍。
尤其是在操作路径上,StartLux 要简洁得多,全程只用了 12 步,而 Sonnet 足足用了 21 步。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg
这足以说明,在 Agent 任务上,参数规模已然不是唯一的决定性变量。
新的变量,是后训练。
参数做减法,能力不打折
StartLux-V1.0-27B-Preview 并非从零开始训练。
其实它也是以Qwen3.6-27B为基座的,最终测试分数却要比 Qwen 高不少,原因就藏在任务数据和自动化后训练方法里。
简单来说,StartLux 训练的是一个更会干活的 Agent,训练数据重点强化任务理解、工具选择、参数构造、多步执行、状态检查和结果验证等能力。
模型要学会的不只是给出最终文本,还包括什么时候调用哪个工具、工具返回异常后如何调整,以及什么情况下才能宣布任务完成。
接着后训练将这个过程推得更远。
团队自主研发出一套全新的多维度、可验证、可规模化的模型迭代优化技术,其中采用AI 训练 AI(Auto Research)的方法,让模型能在真实工具环境中自主执行任务,再根据环境反馈持续调整策略。
比如前文提到的金融分析案例,其中的回查修正,以及浏览器任务里的约束识别和路径选择,正是这种后训练最直观的体现。
据官方介绍,StartLux-V1.0-27B-Preview 也是国内首个采用 Auto Research 方式完成后训练的本地 Agent 模型。

诚然,这并不意味着 Scaling Law 失效了。
大参数云端模型仍然是当下的主流选择,但 StartLux 也给出了清晰的信号:这并非唯一通解。
用陈大年的话来说:
Scaling Law 是“过路神仙”,没有它,AI 起不来。但它只是从 AI 的发展路径上路过,未来不一定属于它。
行业同样也意识到了这个问题,目前大模型技术路径正呈现出显著分野的趋势:
一边是“大力出奇迹”的忠实信徒,参数从百亿卷到千亿,再卷到万亿,训练成本也跟着指数级攀升;
另一边是以 Harness 为代表的 Agentic 评估体系迅速走红,越来越多专家学者开始明确“少即是多”。
化用王阳明的说法,知行合一,更高质量的行动才是关键。StartLux 为模型做减法提供了又一例证。

这也可以解释 StartLux 为什么坚持本地模型。
模型一旦进入 PC,对于长时任务,其成本结构可以从持续累积的云端 Token 费用,转化为更可控的设备算力和电力消耗,同时模型也能更好地理解用户的长上下文,实现更个性化的目标。
不止 StartLux,Meta、Google、NVIDIA最近也在加码本地小模型方向。
不过这些大多还都停留在实验阶段或偏向极客,以本地模型产品化为主的,目前只此一家。
StartLux 也表示,后续它们将稳步推进自有基模训练,探究扩散式语言模型等新架构,总之路线对了,那就未来可期。

StartLux 接棒本地模型
既然这是一条非共识的路线,掌舵的就需要两种人:敢下注的和能做出来的。
StartLux 的明星天团恰是如此,企业家+科学家强强联合。

StartLux 创始人陈大年
CEO陈大年此前已经简单介绍过了,是连续创业者也是中国初代程序员,跟张小龙、雷军同期成名,创业时间跟马云、马化腾同代。
他是中国最早引入“共享软件”概念的人,和二哥陈天桥一起创办盛大网络以及互联网创新摇篮之一的盛大创新院,国民级产品“WiFi 万能钥匙”也是由他一手孵化。
可以说,他对中国市场的用户和产品了如指掌,本地模型也算他的舒适区。

StartLux 联创郭权玮
负责把技术路线落地的,是 StartLux 联合创始人兼 CTO郭权玮
郭权玮拥有国立阳明交通大学计算机科学与工程博士学位,研究方向覆盖本地部署大模型、Agentic AI、AI for Science、AI for Finance 和隐私保护机器学习等领域。
加入 StartLux 前,他曾任 AI 科学公司幻量科技首席算法科学家,更早之前在台湾工业技术研究院从事数据隐私、数据去标识化和隐私保护机器学习研发。
他还是2024 年 TAAI 最佳论文奖获得者,并以第一发明人身份拥有数据隐私相关发明专利。
而 StartLux 另一位联合创始人罗永祥,则是前摩根士丹利亚洲董事总经理。
陈大年懂产品和用户,郭权玮长期研究本地模型、Agent 和数据隐私,罗永祥负责市场和投融资。这套组合高度适配 StartLux,也将助力 StartLux 长线发展。

至于团队最终想交付的,也不只是一份模型权重。
在 StartLux 的构想中,本地智能解决方案应该像安装 Office一样,一键完成部署。用户不需要理解量化、显存配置和推理框架,也不用自己反复调优。
所以目前,团队计划面向企业和个人用户,在年内推出第一代本地智能解决方案。
这样看来,StartLux 的横空出世绝非“又多了一个玩家”那么简单。
它也代表着,继 DeepSeek、Kimi 等云端模型公司涌现之后,国产本地模型也开始陆续补位。
从智能时代的后起之秀又兜兜转转回到互联网时代的初代程序员,模型基本范式在换挡,但始终有中国公司在接力往前跑。
