中国大模型不断突破 沪企StartLux 直接逼近DeepSeek-V4-Pro
广东
广东 > 滚动新闻 > 正文

中国大模型不断突破 沪企StartLux 直接逼近DeepSeek-V4-Pro

过去两年以来,全球AI行业竞争日益激烈,他们不断把模型做大:更多参数、更大算力、更长上下文,以及不断刷新的Benchmark成绩。但进入2026年,随着基础模型能力持续提升,全球AI竞争正在出现新的变量——如何让模型以更高的训练效率、更低的边际成本持续变强,以及如何让AI本身参与AI的研发过程。

中国AI企业也正在进入这场变化之中以惊人的优势获得了认可。最近在工信部中国信息通信研究院可信AI大模型基准测试MCP专项测试中,上海AI公司StartLux最近推出的StartLux-V1.0-27B-Preview综合排名第二,超过DeepSeek-V4-Flash-0731,与1.6万亿参数的DeepSeek-V4-Pro差距约1个百分点,并在位置导航、浏览器自动化、金融分析等Agent任务中取得第一或并列第一的成绩。该公司第一代本地智能解决方案也预计将于年内推出。

中国大模型不断突破 沪企StartLux 直接逼近DeepSeek-V4-Pro

StartLux-V1.0-27B-Preview提供了一个颇具代表性的样本:它没有继续沿着单纯扩大参数规模的路径竞争,而是选择从本地部署、后训练效率和Agent真实任务能力切入,并进一步尝试让AI参与模型自身的研发。

Auto Research:70%实验研发交给AI

StartLux-V1.0-27B-Preview定位为面向真实任务执行的本地 Agent 模型,“本地”解决它在哪里运行,“Agent”解决它能不能工作。值得注意的是,市场其实不缺能下载到电脑里的模型,缺的是能真正替用户工作的本地 AI。StartLux团队表示,公司真正的壁垒,是让模型和它工作的整套系统一起进化。

这就不得不提到StartLux的训练方法。StartLux-V1.0-27B-Preview以Qwen3.6-27B为基座进行后训练,把模型能力进一步集中到真实任务上,并在训练过程中引入了AI训练AI(AI for AI:Auto Research)的方法。这是内地首个采用该方法进行后训练的本地Agent模型。

StartLux团队认为Auto ResearchAI是指AI看完上一轮实验结果以后,能不能自己判断下一步值得试什么。如果只是批量生成Synthetic Data,或者自动搜一组超参数,它只能叫自动化,而不是Research。真正的 Auto Research 应该能形成“假设—实验—验证—新假设”的闭环。Auto Research与知识蒸馏完全不同,蒸馏更像老师给答案、学生模仿;Auto Research 里,强模型更像研究员,会设计实验、出题、看结果、找失败原因,再决定下一轮怎么训练。

例如金融分析,早期模型拿到一个看似合理的数据就容易直接算,但环境反馈会暴露日期、交易日或原始数据不一致的问题。Auto Research 会从这类失败轨迹里归纳问题,再补充“回查原始数据—确认目标条件—再计算”的任务和轨迹。它不是AI凭空发明一个新算法,而是AI自己从失败里决定下一轮该补什么。AI当然也会跑偏,所以只要出现某一类Eval涨了但泛化变差,或者明显在钻评分机制的漏洞,StartLux就会人为干预。

据团队透露,在StartLux现有的研发体系中,大约70%的实验研发工作由AI完成,包含提出实验假设、生成或筛选数据、启动训练和Eval、分析失败轨迹,再根据结果决定下一轮试什么。人类研究员主要负责最关键的那件事:决定研究方向和关键取舍。

对于企业和个人而言,本地Agent模型可能带来两种根本性的改变:成本与数据主权。当一个能力接近旗舰的Agent能够在个人电脑上长期运行,企业不再需要为每一次推理向云端付费、为每一次任务上传核心数据。对于高频调用、数据敏感、需要长时间执行的工作流——例如金融分析、代码仓库管理、私密文档处理、长期研究任务——本地Agent意味着数据不出域、Token不受限、任务可以连续运行数小时,而非在云端逐次计费。StartLux 联合创始人罗永祥认为本地AI真正值得关注的不是“省下一次调用的钱”,而是当AI从偶尔使用的工具变成持续工作的基础设施后,成本结构本身会发生变化。他表示:“过去企业使用AI,更像是在购买算力和调用次数;但当Agent开始长时间参与真实工作流,成本就不再只是一次调用多少钱,而是每天、每月、每年持续运行的总成本。本地部署的意义,是把一部分持续性的AI使用成本,从按调用付费,变成一次部署、长期运行。”

在罗永祥看来,这种变化最终也会体现为企业的成本结构。“如果过去模型能力的竞争,本质上是算力、数据和人才的投入竞争,那么下一阶段比拼的可能是谁能用同样的人和算力,完成更多有效实验。Auto Research的价值不只是让实验跑得更快,而是把研发资源从重复性的执行工作中释放出。”

StartLux,中国AI的RSI先行者

Auto Research指向的正是RSI(Recursive Self-Improvement,递归式自我改进)这个当前全球AI研发的前沿——AI更深地参与自身研发与改进,并最终让更强的AI参与创造下一代更强的AI。

近期,RSI正汇聚全球顶级AI机构的核心注意力。过去一年,OpenAI、Anthropic等头部实验室都开始把AI从代码助手进一步带入模型研发本身:从编写训练代码、生成数据,到运行实验、分析Eval,再到探索由AI提出研究假设、决定下一轮实验。OpenAI近期披露,其内部已经开始形成类似“自动化研究实习生”的AI工作体系:截至2026年8月,其研究组织中,每1个人类研究日对应约3.1个AI Agent工作日,AI Agent已经能够承担代码编写、实验运行、结果分析等越来越长的研究任务。Anthropic也披露,Claude已经能够编写其公司超过80%的生产代码,并进一步探索让AI参与下一代AI系统的研发。让AI深度参与AI的研发与改进,已成为国际前沿的明确共识。StartLux则将同一路径落地在27B本地模型上,成为全球范围内将RSI理念率先融入本地Agent后训练体系的具体实践者。

据了解,罗永祥曾任摩根士丹利亚洲董事总经理,在资本市场深耕接近30年。他过去的工作是判断什么值得投资;这一次,他从30年资本圈的老手,投入到RSI创业的新路上。在他看来,AI正在进入一个新的阶段:一端是模型从云端走向本地,另一端则是AI开始参与AI自身的研发,尤其是RSI,正在打开一个更具想象力的方向——让AI更深地参与自身研发与改进,并最终让更强的AI参与创造下一代更强的AI。这也是他决定投身AI创业的重要原因之一。

按照规划,StartLux将通过新模型架构、训练算法和受控的本地参数更新机制,让模型逐步具备在本地持续自我更新的能力。目前的StartLux-V1.0-27B-Preview可在消费级个人电脑上运行,团队正推进模型的备案。第一代本地智能解决方案也预计将于年内推出。

中国大模型不断突破 沪企StartLux 直接逼近DeepSeek-V4-Pro