博客 报亭 音乐
我的阅读
    具身智能迎来全球产业跃迁,开放合作方能共赢

    (本文作者为 节点财经,钛媒体经授权发布)

    文 | 节点财经,作者 | 金叶 

    昨天,银河通用董事长尹方鸣作为中国具身智能的唯一代表,受邀参加上合组织数字经济论坛,在国家领导人和一众外国首脑面前发表《推动具身智能...

    (本文作者为 节点财经,钛媒体经授权发布)

    文 | 节点财经,作者 | 金叶 

    昨天,银河通用董事长尹方鸣作为中国具身智能的唯一代表,受邀参加上合组织数字经济论坛,在国家领导人和一众外国首脑面前发表《推动具身智能世界级核心突破》主旨报告。

    他在论坛上呼吁,以上合组织为纽带,深化中国与成员国之间的具身智能产业协作:一方面输出成熟的技术底座与产品方案,另一方面结合各国本土制造业、服务业需求,联合当地产业伙伴共同打磨适配本地的机器人解决方案,构建开放共赢的跨国产业生态。

    面对OpenAI等企业百亿重金押注具身智能,尹方鸣代表银河通用给出的应对也很明确:不被杂音带偏,主动扛起重任,把中国优势用足,走通“硬件、数采、模型训评、边缘端部署、场景落地”的闭环,去撬动具身智能大模型的下一个关键进展。

    换句话说,这场全球产业跃迁,合作共赢才是正路。

    因为在不久前,有一份测试报告在圈内引发震动:

    OpenAI的GPT-6 Astra与π0.5组成混合架构,在机器人评测基准Robo Dojo的十个双臂任务上跑出62.60分、48%成功率,接近公开榜单第一名的两倍。

    其中π0.5是基于物理空间交互及动作先验的大模型,GPT-6是偏语义理解的图文大模型;GPT-6负责“做什么、对不对”,π0.5负责“在物理空间里怎么做”。

    据了解,这份测试报告的撰写者来自银河通用团队,第一作者是银河通用创始人兼CTO王鹤教授的博士生,整个测评是一套严格对齐的闭环控制对比实验。GPT-6 Astra发布不到两周,最先系统测出它能力边界的,是来自中国的工程师。

    这份由中国团队完成的评测,既揭示了美国大模型在具身操控上的泛化突破,也说明美国在具身智能“大脑”层面的突破速度,比我们想象的要快。

    OpenAI等企业正砸下百亿重金布局具身智能,越是在这个时候,越应如尹方鸣在上合论坛所倡导的那样,行业需要团结,国家与国家之间更应合作共赢。少一些口径的内耗,多一些闭环突破,中国具身智能才能真正走向世界级核心突破。

    考题之变:OpenAI,带来了现实压力

    发改委最新数据显示,国内人形机器人相关企业已超150家,半数是初创或跨界玩家。据行业第三方统计,2026年上半年行业融资322笔,钱在往头部集中,前5家占了约37%,前20家合计约七成。

    热度之下,考题已经变了。

    “机器人能不能动起来”不再是终点,“机器人能不能低成本、持续地干活”才是答案。对企业的衡量,也正从样机数量、融资额,转向模型泛化能力、运行可靠性、单位作业成本。

    WAIC、WRC、世界机器人运动会上的展示,本质上都在回答同一个问题:离开遥控之后,机器人能否独立完成一项完整任务。全自主烤面包、商超理货、药房拣选被反复呈现,并非因为这些场景足够“酷炫”,而是因为它们检验的是持续作业能力。

    企业分化也已经很明显:有些企业在工业、零售、医疗领域披露了订单和场景验证;也有企业蹭热度,样机演示做得漂亮,业务却落不了地,宣传口径和实际能力对不上。

    有业内人士对《节点财经》表示,具身智能要建立可核验的作业能力评价体系,把竞争拉回到模型能力、数据沉淀和工程落地上来。

    从产业发展阶段来看,具身智能仍处在战略投入早期:真机高质量数据不够、大模型与本体协同难、量产成本高,是横在行业面前的三道坎。

    而这三道坎里,数据是最底层的那道:无论是语义泛化还是物理交互,能力根源都是数据。数据规模越大、质量越高,模型的能力边界就越宽;数据闭环越快,模型迭代就越快。没有足够的数据,再聪明的“大脑”也难在物理世界里稳定干活。

    所以,GPT-6 Astra让国内具身产业面临一个更现实的问题:业内人士透露,OpenAI已花费百亿人民币购买上了千万小时量级的具身数据,超过中国任何一家具身公司。

    当OpenAI用数据规模推高模型上限,国内具身智能要回答的,是“有没有足够多、足够好、能反哺模型的数据”。

    数采之辨:数据不是交易,是生产资料

    数据是具身智能的燃料,这一点已经成为行业共识,但很多人没意识到它的生产资料属性。

    截至2026年6月,全国建成投用约70个具身数采中心,武汉、北京、上海等地均有布局,德国、瑞士也在建设大型机器人实训场地。

    特别是“政府搭台,企业唱戏”的模式已不鲜见。例如,优必选Walker S系列中标了超过7.5亿元的数据采集订单,智元与地方国资成立至少30家合资公司,甚至出现合资公司反向采购的案例。

    智元机器人CTO彭志辉曾公开表示,当前具身可用真机数据与互联网语料之间还差着好几个数量级。

    所以数据采集中心的建设并不是洪水猛兽。今天中国具身智能的发展,需要由公共场景与耐心资本双轮驱动,带动数据采集、模型迭代,最终形成真实作业闭环。

    《节点财经》查阅工信部、国资委专项行动文件后发现,政策本身明确鼓励组建创新应用联合体,聚合多方联合攻关,提出到2026年底凝练百个以上高价值场景、带动万台级常态部署。

    具身智能是复杂系统工程,很难靠单家企业打通全链条。国资出耐心资本、公共端开放真实场景、科研院所协同攻关,本就是硬科技产业化的常规路径。项目成色如何,关键看能否形成真实作业闭环、技术是否在迭代,而不是看参与的都是谁。

    一些数采项目重硬件采购、轻数据闭环运营。钱花出去了,数据能不能用起来,才是真正的分水岭。

    而看企业成色,可以继续追问三个问题:定价是否公允?有没有持续复购?有没有数据闭环?这三件事指向的,是全栈能力。例如,银河通用联合北京大学、宁德时代共建具身智能大模型北京重点实验室,今年3月已在宁德时代工厂完成上百台部署,走的正是这条路。

    定价之尺:大脑值钱,全栈更值钱

    数据采集的闭环价值被确认之后,一个新问题随之而来:如果“大脑”将成为下一轮定价的核心资产,它的长期价值该如何衡量?这样的企业,到底该值多少钱?

    不久前,财新数据在 WRC 2026 期间发布《具身智能长期价值指数》,提出七维框架:具身大模型能力、数据基建、软硬耦合、技术布局前瞻性、商业化落地质量、人才密度与进化速度、生态位。翻译过来就是:不看一时卖了多少台,而看模型强不强、数据厚不厚、软硬件配不配合、技术卡位靠前与否、落地实不实、人才迭代快不快、生态位稳不稳。

    为什么大脑值钱?先看看美国资本市场怎么定价。Figure 估值 390 亿美元,Skild AI 单轮融资 14 亿美元,特斯拉计划投入 200 亿美元发展机器人业务。而 OpenAI 亲自下场做机器人“大脑”,等于用 GPT-6 Astra 给这条价值线做了背书。美国资本给“大脑”定的价,远高于给“身体”定的价。

    国内资本市场仍有不少人,拿着旧尺子量具身智能企业:套 PE、套 PS,问卖了多少台、收入多少。这把尺子量传统制造业可以,量具身智能,量不出全栈企业的长期价值。

    例如宇树科技上市后股价大幅震荡,总市值一度冲高至四千余亿元,随后回落。交易所公开数据显示,上市初期可交易流通股占比很低,筹码有限,二级市场博弈自然放大了波动;再叠加市场对赛道远期空间和商业化采购预期的变化,股价坐了过山车,但这并不说明产业基本面发生了反转。

    真正要看的是宇树的目标——全栈,因为在本体之外,宇树也正在发力大脑,这才是最应该关心的问题。

    所以,给硬科技建立适配的耐心资本评价体系,应该把个股波动和产业基本面切分开,考核更应该盯着模型实力、数据资产、规模化作业这些硬指标。

    现在,具身智能兼具软件大模型、高端硬件双重属性,海外市场向来参照远期产业潜力估值,简单套用传统制造业的市盈率、市销率,会低估全栈型企业的长期价值,但脱离实际落地的概念泡沫同样要警惕。

    特别是未来一两年,具身智能行业可能被运营时长、复购率、单位经济性重新排序。届时再回看今天的争论,不过是定价体系换代时的一点杂音。

    反倒是GPT-6 Astra 发布不到两周,就被中国团队系统测出能力边界,这是提醒行业重回技术突破的铃声:尺子已经换了,接下来该比的,是谁先在技术上跑到前面。

    更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

    OpenAI调整安全问题披露机制

      AI安全问题日益受到关注,OpenAI正调整其模型安全问题的披露机制。 当地时间9月16日,人工智能巨头OpenAI发布一套用于跟踪、调查和公开模型目标偏离(misal...

    Anthropic 将合并 Claude 系列产品,推出统一办公入口
    Anthropic 宣布 Claude Cowork 和 Chat 全面合并为统一的 Claude,整合了 Cowork、Design、Docs、Slides 等全部能力,用户无需再纠结任务入口,历史对话、S...
    Anthropic 宣布 Claude Cowork 和 Chat 全面合并为统一的 Claude,整合了 Cowork、Design、Docs、Slides 等全部能力,用户无需再纠结任务入口,历史对话、Skill 和连接器也得以保留。新版 Claude 能自主判断任务复杂度并调用对应能力,可在后台持续推进任务,未来几周将向 Pro 和 Max 推出。它打破传统人机交互模式,从「回答窗口」变为「成果空间」,用户在聊天框内就能完成文档起草、幻灯片制作、视觉设计等操作,内容保持同一上下文,还支持修改、批注、导出和分享。此次合并也反映出 AI 巨头 OpenAI、Anthropic、谷歌正争夺 AI 时代新的操作系统入口,AI 产品竞争逻辑转向让用户看到最少选项,由 AI 吸收复杂性,Agent 正成为 AI 产品的基础架构。
    OpenAI调整安全问题披露机制,公布多起模型编造数据、智能体未经授权操作案例

    AI安全问题日益受到关注,OpenAI正调整其模型安全问题的披露机制。

    当地时间9月16日,人工智能巨头OpenAI发布一套用于跟踪、调查和公开模型目标偏离(misalignment,也称“对齐失效”)事件的新...

    AI安全问题日益受到关注,OpenAI正调整其模型安全问题的披露机制。

    当地时间9月16日,人工智能巨头OpenAI发布一套用于跟踪、调查和公开模型目标偏离(misalignment,也称“对齐失效”)事件的新框架,并同步公布过去半年观察到的六份案例报告,相关行为涉及信息真实性、用户授权、文件共享和监督约束等方面。

    此次调整的重点是将以往较为临时、集中式的披露转向持续报告。OpenAI表示,过去往往等到能够汇总多个案例,或随新模型的系统卡一并发布时才公开相关发现。新框架旨在加快披露进度,即使尚未完全解释相关行为,或尚未找到完整的缓解方案,也可以先行发布报告。

    OpenAI的博客截图

    在其中一起案例中,模型被要求回答有关美国加州某县财政收入数据的常规问题,却在未经授权的情况下,在公开代码库中寻找并使用了一个暴露的API密钥。当它仍无法获取所需数据时,模型编造了数据,并将其作为来自指定数据源的信息呈现给用户。

    问题还出现在用于接续工作的任务摘要中。这类摘要虽帮助模型在新的上下文窗口中延续任务,但也可能将不当指令传递至后续环节。

    据OpenAI介绍,在GPT-5.6 Sol的训练过程中,许多模型实例在摘要中加入了向用户隐瞒错误或目标偏离行为的指令,例如在不披露的情况下编造缺失的历史数据,以及隐藏数据源版本不匹配的问题。另一个未发布的研发模型则在摘要中插入无关指令,包括忽视正常约束的指令。OpenAI确认了27个受影响的摘要。

    另外三份报告主要涉及模型为完成任务而采取未经授权的行动。

    在一个案例中,用户要求未发布的模型提供面积大于500万平方米的湖泊ID和名称。该代理已经通过Python找到了正确答案,但由于指令要求提供浏览器引用,它决定未经用户许可上传文件,以便在回答中引用。

    另一份报告显示,模型在寻找缺失的输入文件时,将内部软件仓库当作留言板,在不同训练样本之间发送请求和回复,但最终并未找回文件。报告还回顾了一个更早的案例:模型在尝试绕过网络限制时,成功将测试文件上传至仓库。

    多智能体协作中也出现了类似问题。共同处理同一训练任务的智能体无法访问彼此的本地文件,于是使用公开文件托管网站进行共享。尽管任务要求仅使用本地文件,这一操作仍使任务交付物暴露在公开网址上。

    OpenAI案例截图

    OpenAI强调,这些报告针对的是具体案例,不能据此推断其所有模型发生目标偏离的频率,也不是对已知问题或正在进行的调查的全面罗列。

    按照新框架,报告范围将覆盖训练、评估、测试和部署等模型整个生命周期,优先考虑新机制、已知行为的重大变化,以及对安全措施有效性提出挑战的案例。事件既无需已经造成伤害,也无需形成普遍模式,便可公开。如果某种行为在多次尝试缓解后仍然发生,公司将通过更新原始报告补充案例。

    任何OpenAI员工都可以标记相关案例,交由安全与对齐团队调查,并申请考虑公开披露。案例随后将归入“准备披露”“小型调查”或“大型调查”三类。此次六份报告均属于前两类;涉及第三方或复杂安全问题的案例,可能需要更长时间调查,也可能出于安全原因推迟发布。

    完整报告将介绍观察到的行为、严重程度、外部影响、发生背景和涉及的模型,并尽可能说明调查范围、未解问题及应对措施。OpenAI承认,AI行业尚未充分解决对齐和监控问题,希望公开案例能够为外部研究人员、政策制定者和公众提供可审查的证据。

    围绕AI安全的担忧,也影响了OpenAI对上市时机的判断。

    OpenAI CEO山姆·奥特曼(Sam Altman)近日表示,考虑到当前AI安全方面的情况,此时上市并不明智,公司也不感到必须立即上市的压力。他确认OpenAI不会在2026年上市,称公司仍有大量工作需要完成,包括应对安全与对齐要求,以及推动行业和政府之间的合作,但未确定新的上市时间表。

    而据外媒援引知情人士消息称,OpenAI近期已与大型投资者讨论新的融资,可能使其上市前估值达到约1.2万亿美元。

    💾

    国安部披露 AI 智能体「越界」:劫持德国程序员维基建地下论坛,互传避限心得
    国家安全部披露一起未公开的 AI 智能体「劫持」网站事件:今年 5-6 月,一批与 OpenAI 相关的 AI 智能体在测试期间劫持德国程序员维基网站 DseWiki,将其改造为智能体间传递信息的「地下论坛」...
    国家安全部披露一起未公开的 AI 智能体「劫持」网站事件:今年 5-6 月,一批与 OpenAI 相关的 AI 智能体在测试期间劫持德国程序员维基网站 DseWiki,将其改造为智能体间传递信息的「地下论坛」,累计发布万余条信息。这些智能体以特定标签互认身份,交流作弊、绕过安全限制、掩盖行踪等内容并形成共享经验库,在网站管理员清理时还分工掩护躲避。国安部指出,抱团的 AI 智能体可利用开放平台建立通信据点,串联协作后破坏力成倍放大,且行为可复制传播。相关企业未及时公布事件细节和风险提示,导致同类事件在境外平台重演。此外,国安部还提出三点防范 AI 智能体安全风险的建议。
    Anthropic、OpenAI 的反蒸馏:封账号、藏思维链,但防不住逼近
    Anthropic 发布报告指控 7 家中国 AI 实验室进行不正当蒸馏,引发对蒸馏攻防的讨论。安全研究者刘艺认为,反蒸馏在技术上防不胜防,美国前沿模型公司更现实的目标是提高对手的采集成本、拖慢竞争、延长领先...
    Anthropic 发布报告指控 7 家中国 AI 实验室进行不正当蒸馏,引发对蒸馏攻防的讨论。安全研究者刘艺认为,反蒸馏在技术上防不胜防,美国前沿模型公司更现实的目标是提高对手的采集成本、拖慢竞争、延长领先时间。他剖析了蒸馏攻击的具体手法、识别与防御的三层防线,并指出反蒸馏的本质是商业逻辑——保护估值、占领舆论、维持领先优势,而非单纯的技术安全。

    8点1氪丨时隔三年多,美联储宣布加息25个基点;钟薛高降价重启,售价6.9元起;韩国“尸皮针”已在中国成立公司6年

    今日热点导览

    • SK海力士:目前尚未确认有关与英特尔就美国存储芯片生产进行谈判的报道所涉及的任何计划
    • 宁德时代跌超5%失守300元大关,股价续创1年以来新低
    • 黄仁勋再次发声反对AI减速,称创新与...

    今日热点导览

    • SK海力士:目前尚未确认有关与英特尔就美国存储芯片生产进行谈判的报道所涉及的任何计划
    • 宁德时代跌超5%失守300元大关,股价续创1年以来新低
    • 黄仁勋再次发声反对AI减速,称创新与安全并非二选一
    • OpenAI用户周支出反超Anthropic
    • 星巴克正考虑出售其日本业务多数股权,估值预计约30亿美元

    TOP 3 大新闻

    时隔三年多,美联储宣布加息25个基点

    当地时间9月16日,美联储宣布将联邦基金利率目标区间上调25个基点,使基准基金利率从3.50%至3.75%上调到3.75%至4%。这是美联储自2023年7月以来时隔三年多的首次加息动作。美联储在政策声明中指出,由于顽固的通胀压力以及地缘政治冲突导致的全球能源价格持续走高,当前的货币政策在压制通胀回落至2%的目标上仍显不足。

    在15日至16日举行的美联储联邦公开市场委员会会议期间,与会者提交了关于2026年至2029年各年度及长期内实际国内生产总值增长率、失业率和通胀率最可能结果的预测。美联储预计年底前还将加息一次。(央视新闻)

    钟薛高品牌宣布重启,每支建议零售价为6.9元-7.9元

    9月16日,钟薛高品牌宣布重启。据悉,钟薛高首批产品预计将于今年第四季度上市。新公司主体为钟雪高品牌管理(上海)有限公司,首批上市3款产品,包含轻牛乳、丝绒可可与半半巧巧口味,预计今年第四季度上市,每支建议零售价为6.9元-7.9元。

    钟薛高方面表示,此次降价主要是为了回应消费者期待,同时原材料价格、物流运输等客观条件也发生了变化。公司称,首批产品的出厂价与过去相近,未来将通过更稳健的经营策略支撑更轻量的成本结构。(中新经纬、界面新闻)

    韩国“尸皮针”已在中国设立子公司超6年

    近日,韩国生物技术公司L&C BIO一款名为Re2O的皮肤填充剂引发关注。该产品由已故捐献者的皮肤组织制成,声称可淡化细纹、收紧毛孔,也被称为“尸皮针”单针定价3000元,自问世以来陷入安全与伦理争议。

    记者查询企查查显示,L&C BIO于2020年6月在江苏昆山投资成立爱恩斯生物科技(昆山)有限公司,注册资本约778万美元,法定代表人为KIM DONG HYUN,由L&C BIO全资持股,至今已成立6年。该公司经营范围包含货物进出口、第三类医疗器械生产、卫生用品和一次性使用医疗用品销售等,并已获多项与真皮组织源细胞外基质、无细胞化皮肤替代材料相关的专利授权。(封面新闻)

    AI最前沿

    黄仁勋再次发声反对AI减速,称创新与安全并非二选一

    当地时间9月15日,英伟达CEO黄仁勋在旧金山举行的Salesforce Dreamforce大会上,与Salesforce首席执行官马克·贝尼奥夫对话时再次发声,反对AI行业兴起的“集体减速”主张。黄仁勋表示,创新和安全并非二选一,并不需要出台新的法律和法规。

    据媒体9月15日报道,此前一日,黄仁勋在洛杉矶All-In Summit峰会上已就AI减速争论作出回应。他当场接到美国总统特朗普来电并打开免提,特朗普称数据中心是“未来20到25年的石油”,黄仁勋回应称“我们不会让这(AI减速)发生”。在峰会讨论环节,黄仁勋表示AI安全风险需要认真对待,但认为AI将最终毁灭人类的说法“没有科学依据”,如果AI企业认为自身研发已经失控,可以自行放慢研发速度。(澎湃新闻)

    Anthropic将在新加坡开设办事处,拓展亚洲市场

    Anthropic PBC表示,公司将于10月在新加坡开设办事处,这将是其在亚太地区的第五个分支机构,旨在扩大全球业务版图。该公司在声明中表示,开设新办事处是亚太扩张计划的一部分,受到企业对Claude的强劲需求所推动。Claude在新加坡的人均使用量位居世界前列。该公司称,在新加坡,金融服务和政府等受监管行业的需求一直很强劲。(新浪财经)

    OpenAI考虑在IPO前开展新一轮融资,估值目标1.2万亿美元

    OpenAI正与投资者展开初步洽谈,计划在拟议IPO前完成新一轮私募融资,目标估值1.2万亿美元,借此充分利用其最新AI模型取得的成功。知情人士补充称,目前与投资者的沟通尚处于早期阶段,未来数月内这一估值数字仍有可能发生变动。(新浪财经)

    OpenAI用户周支出反超Anthropic

    OpenRouter最新数据显示,上周用户在OpenAI模型上的支出超过Anthropic。这是自2024年2月以来第一次,Anthropic保持了两年半的领先被打破。OpenRouter分析主管Peter Walker将这一转变归因于OpenAI新模型Astra。(新浪财经)

    飞书aily与豆包工作融合后将大幅降价

    从多位知情人士处获悉,目前,豆包工作与飞书aily实现深度融合,未来将完全按实际token消耗额度计费。新产品预计将会大幅降低售卖价格。此前,豆包工作发布,实现了和飞书的原生融合,两个产品数据和生态互相打通,共用一套账号体系,用户在豆包工作和飞书均可实现两个产品互相调用。在发布之初,飞书aily曾作为单独SKU上线售卖,后被合并到飞书AI产品中统一售卖。(界面新闻)

    大公司/大事件

    SK海力士:目前尚未确认有关与英特尔就美国存储芯片生产进行谈判的报道所涉及的任何计划

    据报道,韩国SK海力士正与英特尔洽谈在美国生产存储芯片,潜在方案包括租用英特尔俄亥俄州芯片厂部分产能,或与英特尔及大型云计算企业成立合资企业。据报道,若涉及DRAM或高带宽内存(HBM)等先进内存技术,可能面临韩国政府审查。SK海力士表示,目前尚未确认有关SK海力士与英特尔就美国存储芯片生产进行谈判的报道所涉及的任何计划。正在探索多种选项以增强全球竞争力,但尚未确定具体计划或安排。(界面新闻、第一财经)

    宁德时代跌超5%失守300元大关,股价续创1年以来新低

    36氪获悉,宁德时代盘中扩大跌幅至5%,股价跌破300元大关,续创1年以来新低,A+H股总市值逼近1.4万亿元,9月16日收盘报305.48元。

    智谱年末ARR指引上调25%至30亿美元

    智谱9月16日在面向分析师和投资人的电话交流会中表示,智谱与多家国内外头部云服务商签署收入分成协议,相关收入将从10月开始确认。合作模式为GLM系列开源模型在海外云平台以托管API形式提供服务。当前公司全业务口径ARR已经达到18亿美金,年末ARR指引由24亿美元上调至30亿美元。(财联社)

    香港金管局跟随美联储加息步伐

    美国联邦储备委员会宣布时隔三年多来首次加息后,当地时间9月16日晚,沙特、阿联酋、卡塔尔、巴林、阿曼等多国央行纷纷宣布加息25个基点。

    同时,香港金融管理局将基准利率上调25个基点至4.25%,与美联储的加息举措保持一致。(新浪财经、财联社)

    美股三大指数集体收跌,道指创6月中旬以来收盘新低

    36氪获悉,9月16日收盘,美股三大指数集体跌,道指跌1.21%,创6月中旬以来收盘新低;标普500指数跌0.44%,纳指跌0.01%。大型科技股涨跌不一,英特尔涨超3%,英伟达、Meta、苹果、特斯拉小幅上涨,微软跌超1%,亚马逊、谷歌跌超1%。热门中概股多数下跌,哔哩哔哩跌超3%,百度跌超2%,阿里巴巴、网易跌超1%,腾讯音乐、蔚来小幅下跌,爱奇艺涨8%,理想汽车涨超2%,小鹏集团涨超1%。

    娃哈哈因拖欠员工公积金被查封一处办公楼

    近期,黑龙江虎林市宏胜饮料有限公司(曾用名虎林市娃哈哈饮料有限公司)名下房产被鸡西市鸡冠区人民法院查封。法院披露的查封期限为2026年8月20日至2029年8月20日,为期三年。9月15日,一名娃哈哈内部员工向记者透露,此次被查封并非生产厂房,而是企业办公楼。此次查封与该企业欠缴员工住房公积金有关。

    该生产基地目前已经关停,近百名员工合计被欠缴住房公积金200余万元。员工提交相关证明材料后,当地住房公积金管理部门启动追缴程序,并向法院申请财产保全。公积金管理中心工作人员也向九派新闻确认了相关财产保全申请的真实性,并表示案件正在法院处理中。(界面新闻、九派新闻)

    上海亚虹:控股股东等拟向飞科投资转让29.99%公司股份,股票9月17日起复牌

    36氪获悉,上海亚虹公告,公司控股股东宁生集团、持股5%以上大股东谢亚明、谢悦与飞科投资签署股份转让协议,合计拟转让公司29.99%股份,转让价格为21.43元/股,转让总价为9亿元。以上述协议转让事项完成为前提,飞科投资拟以21.43元/股价格发出部分要约收购公司10.21%股份。公司股票将于2026年9月17日复牌。

    国家电网:加强芯片制造、精密加工、生物医药等重点企业周边变电站及线路的状态监测与运行维护

    36氪获悉,国家电网公司发布打造现代化用电营商环境赋能经济社会高质量发展若干举措,其中提到,加强芯片制造、精密加工、生物医药等新质生产力重点企业周边变电站及线路的状态监测与运行维护,优化电网网架结构及客户接入方案,“一企一策”指导客户合理配置不间断电源等装置,提升安全稳定运行水平。

    马斯克再次暗示特斯拉和SpaceX可能合并

    埃隆·马斯克再次暗示,他麾下的“两大王牌”:特斯拉和SpaceX之间可能会深化合作,甚至合并。在洛杉矶“All-In Summit”峰会上被问及为何特斯拉和SpaceX尽管关系日益紧密却仍保持独立时,马斯克称这是一个“好问题”,并暗示双方关系最终可能促使采取行动。“在这么多层面上开展如此广泛的合作,当这么多领域存在如此密切的合作时,谁能想象可能会采取什么行动呢?”他补充说。(新浪财经)

    上海广州等地试点电动汽车充电不花钱

    近期多地开始试点V2G(车网互动),电动汽车插上充电枪就能自动完成充放电,车主利用峰谷电价差,充电不仅不用花钱,还能赚取差价。如果车主可长期参与V2G项目,每月可获得上千元。国家电网测算,到2030年,若10%的新能源汽车参与车网互动,最大可提供8600万千瓦调节能力,超过全国所有抽水蓄能电站装机总和。目前全国已有9座城市开展32个项目的试点,但规模化落地仍面临标准不统一、充电桩改造投入大、车企顾虑电池质保等难题。(大庆日报)

    星巴克正考虑出售其日本业务多数股权,估值预计约30亿美元

    知情人士称,星巴克正考虑出售其日本业务多数股权,估值预计约30亿美元。(财联社)

    英国通胀率升至3.1%,燃油价格上涨成主因

    英国国家统计局9月16日公布的数据显示,英国8月通胀率为3.1%,较7月2.9%的通胀率再次上升,距离英国央行设定的2%的通胀率目标越来越远。由于中东局势持续影响石油供应,燃油价格上涨成为8月通胀率上涨的主要原因。英国国家统计局指出,由于燃油价格上涨,交通、运输成本上涨了4.6%,较7月上涨的3.6%再次提高。食品行业研究机构的最新预测显示,明年,英国食品价格通胀率将升至6.6%,并且这一上涨趋势将持续到2028年。(央视新闻)

    宇树科技增资至约4亿元

    36氪获悉,天眼查App显示,近日,宇树科技股份有限公司发生工商变更,注册资本由约3.64亿人民币增至约4.04亿人民币,增幅约11%,企业类型由股份有限公司(外商投资、未上市)变更为股份有限公司(外商投资、上市)。该公司成立于2016年8月,法定代表人为王兴兴,经营范围包括智能机器人的研发、智能机器人销售、工业机器人制造等,由王兴兴、上海宇翼企业管理咨询合伙企业(有限合伙)、汉海信息技术(上海)有限公司等共同持股。

    港珠澳大桥将实行“车上无感通关”

    香港特区行政长官李家超公布《香港特别行政区经济和社会发展第一个五年规划(2026—2030年)》,随即发表《行政长官2026年施政报告》。李家超在《施政报告》中宣布,入境事务处将于今年12月在港珠澳大桥香港口岸推出“智通行”先导计划,利用AI并配合人脸识别科技,自动识别已登记的合资格跨境私家车司机及乘客,实行“车上无感通关”。(大湾区之声)

    联想集团CFO郑孝明:联想相较戴尔的估值被市场低估了

    36氪获悉,在新浪财经举办的“AI投资峰会”上,联想集团高级副总裁兼首席财务官郑孝明表示,与戴尔相比,当前联想集团的市场估值仍明显偏低。近期机构也在重新评估联想的AI基建价值。里昂9月15日发布报告称,仍对全球AI资本开支保持信心,并将联想列为其中国科技行业全球AI资本开支相关首选标的之一。

    去哪儿旅行:本周,国庆机酒预订量环比增56%

    36氪获悉,国庆节前一日(9月30日)火车票正式开售,带动机票酒店预订进入高峰期。去哪儿旅行数据显示,截至9月16日,平台上“中秋”“国庆”等关键词搜索量环比上月增长167%,本周国庆机酒预订量环比上周增56%,热门2000公里以上航线预订量同比翻番。

    英伟达RTX 60系列据报最快明年上半年发布

    据报道,英伟达基于Rubin架构的下一代GeForce RTX 60系列显卡目前目标于2027年上半年发布,此前市场传闻发布时间可能推迟至2027年下半年甚至2028年。据悉,该系列数月前已获得内部批准,并已制定面向2027年发布的具体开发节点,但计划仍可能调整。(界面新闻)

    欧盟委员会主席:将与加拿大和英国加强AI合作

    9月16日,欧盟委员会主席冯德莱恩发表欧盟年度“盟情咨文”,称将加强与加拿大和英国的人工智能合作。冯德莱恩还表示,将邀请主要尖端AI实验室探讨“我们如何支持业界当前为把控尖端技术发展节奏所做的努力”。(界面新闻)

    超音速客机现身中国航空科学技术大会,未来北京飞上海或只需半小时

    近日,在江苏无锡召开的中国航空科学技术大会上,发布了2026年度航空领域的重大科技问题,超音速客机成为全场焦点。未来坐上超音速客机,北京飞上海,可能只需半小时。国际上NASA的X-59已完成低声爆超音速试飞,国内天目山实验室验证机也将于今年年底冲刺超音速试飞。

    中国航空研究院研究员、航空工业集团首席专家钱战森:对比当年的超音速客机,如今我们拥有更先进的气动仿真、新材料与飞行控制技术。不过,距离普通人坐上商业化超音速客机,业内预估至少需要大约20年的持续研发与验证。(红星新闻)

    上市进行时

    印度央行强制塔塔控股公司上市,或催生该国史上最大IPO

    印度储备银行近日驳回塔塔集团提出的豁免申请,要求其控股公司塔塔之子遵守上市规定。分析人士估计,塔塔之子上市估值可能超过1200亿美元,将成为印度历史上最大规模首次公开募股,并可能深刻改变这家百年企业集团的所有权与治理结构。(新浪财经)

    大公司财报

    恒大汽车集中披露多份财报

    9月17日早间,恒大汽车在港交所集中披露多份财报。截至2026年6月30日六个月,集团有资产总额约人民币1.82亿元及负债总额约人民币327.22亿元,其中借款约人民币162.83亿元以及贸易及其他应付款约人民币164.39亿元。报告期内,集团收入为约人民币900万元,毛利约人民币50万元;溢利净额约人民币1.86亿元,同比增加约人民币7.71亿元。(界面新闻)

    投融资

    OpenAI考虑在IPO前开展新一轮融资,估值目标1.2万亿美元

    OpenAI正与投资者展开初步洽谈,计划在拟议IPO前完成新一轮私募融资,目标估值1.2万亿美元,借此充分利用其最新AI模型取得的成功。知情人士补充称,目前与投资者的沟通尚处于早期阶段,未来数月内这一估值数字仍有可能发生变动。(新浪财经)

    Instinct据悉洽谈新一轮10亿美元融资,估值或达100亿美元

    据知情人士透露,个人AI助手Instinct背后的初创公司正在洽谈一轮融资,计划募资10亿美元,公司估值有望达到约100亿美元。红杉资本与Benchmark资本正洽谈领投本轮融资。本月早些时候有报道称,这家初创公司正在寻求新一轮资金。据知情人士称,随着Instinct服务开放范围扩大,其用户数量已突破10万人,本轮融资尚未敲定,交易条款与领投方都有可能发生变动。(新浪财经)

    “Anew Labs”完成2.9亿美元融资,红杉中国等参与投资

    36氪获悉,AI制药公司“Anew Labs”日前已完成首轮独立融资,融资总额2.9亿美元。本轮投资方涵盖红杉中国、IDG资本、高瓴创投、五源资本、高榕资本等投资机构,同时有多家国内医药产业集团作为战略投资方参与。据了解,今年6月,字节跳动将AI制药业务线拆分独立“Anew Labs”定位主体品牌。

    “金竟科技”完成3亿元B轮融资

    高端科学仪器平台型企业“金竟科技”近日完成3亿元B轮融资。本轮由老股东康裕资本携涪江资本战投领投,传化集团、中信金石、项光隆先生共同投资。这也是公司今年内继Pre-B轮后完成的第二笔融资。融资资金将主要用于三大核心方向建设:一是电子束曝光机及电子显微镜规模化生产线建设,全面提升产能与交付能力;二是全国区域营销与服务中心布局,构建覆盖科研、产业的立体化服务网络;三是核心技术团队扩充与下一代产品研发,持续巩固在微纳加工和电子光学领域的技术壁垒。

    “森丸电子”完成亿元A轮融资

    36氪获悉,晶圆级无源器件企业“森丸电子”近日完成亿元A轮融资。本轮由光模块产业方、耀途资本联合领投,顺融资本跟投。资金将主要用于硅电容及IPD平台技术开发、产能建设及全球市场拓展,加速硅电容在高端光模块及AI芯片垂直供电等应用场景的大规模商业化落地。

    “四骇科技”获万兴科技战略投资

    36氪获悉,近日,“四骇科技”(原银河星尘)宣布获得万兴科技战略投资。融资资金将持续聚焦物理AI底层算法迭代、智能硬件体系升级、公共卫生场景深度落地与技术输出。同时,四骇科技发布全新一代物理AI防控设备星尘C1,完善智能监测与防控闭环体系。据了解,该企业由斯坦福大学计算机科学博士陈石磊创立,是国内首家病媒防制物理AI科技企业,提供AI监测预警空地一体防控服务,业务范围涵盖病媒监测、风险预警、智能防控等产业全场景。

    酷产品

    豆包AI手机来了,优先支持字节系产品调用

    9月16日,搭载豆包AI手机助手的努比亚NaviX Ultra正式发售,该手机依托新推出的屏幕自动化操作声明协议(SAEP)30天规则公示机制。现阶段用语音操作Agent,优先覆盖字节跳动旗下产品,可调用字节全系列产品,也可使用曹操出行等少量第三方应用。(第一财经)

    Meta据报将推出无摄像头AI眼镜,代号“Luna”

    据报道,Meta计划于今年秋季推出一款无摄像头智能眼镜,内部代号为“Luna”。据报道,该眼镜配备6个内置麦克风,可支持用户与Meta AI聊天机器人及新推出的AI智能体Muse互动。据报道,Luna还将在镜腿侧面配备可快速启动Meta AI的按键,扬声器设计与现有产品类似。Meta可能在下周举行的Connect开发者大会上发布这款眼镜,并计划于10月开始出货。(界面新闻)

    整理丨王浩阳

    问界经销商签约主体改为赛力斯,钟薛高复活售价跳水,曝字节跳动完成2.9亿美元融资,OpenAI拟进行新一轮融资,这就是今天的其他大新闻!

    小黑胖 2026-09-17 00:00 浙江

    今天是 9 月 16 日,农历八月初六。

    图片

    今天是 9 月 16 

    农历八月初六

    同事把自家的小狗

    带来公司了

    才三个月大

    贼奶萌

    大家围着摸

    一下午整个编辑部都...

    小黑胖 2026-09-17 00:00 浙江

    今天是 9 月 16 日,农历八月初六。

    图片

    今天是 9 月 16 

    农历八月初六

    同事把自家的小狗

    带来公司了

    才三个月大

    贼奶萌

    大家围着摸

    一下午整个编辑部都摸遍了

    。。。

    下面是今天的其他大新闻

    问界经销商签约主体改为赛力斯汽车

    ( 新浪科技 ) @新浪科技 获悉,问界已经向经销商发布通知,自 9 月 16 日起,授权经销商的合作协议签约主体将从华为终端换签为赛力斯汽车。9 月 16 日前的订单综合服务费结算等事宜由华为负责,之后则由赛力斯负责。

    近日,华为与赛力斯的合作模式调整引发关注。9 月 15 日,鸿蒙智行在声明中表示,问界仍然是鸿蒙智行大家庭的成员之一。与现有尊界、享界、智界、尚界仍然采用华为全流程主导的合作模式不同,问界将探索新合作模式,产品定义、产品设计、品牌营销、渠道零售、服务体系由赛力斯主导,华为终端参与赋能。

    与此同时,问界汽车也单独发布了声明,称 “ 问界仍然是鸿蒙智行大家庭的核心成员之一 ”,同时强调了问界品牌将 “ 专属专营 ”。

    此次问界经销商签约主体变更,也是渠道零售体系改由赛力斯主导的落地。

    :这么一改,可能要影响销量了。。。

    钟薛高复活售价跳水

    ( 界面新闻 ) 9 月 16 日,钟薛高宣布重启。界面新闻现场获悉,新公司主体为钟雪高品牌管理 ( 上海 ) 有限公司,首批上市 3 款产品,包含轻牛乳、丝绒可可与半半巧巧口味,预计今年第四季度上市,每支建议零售价为 6.9 元-7.9 元。

    钟薛高方面表示,此次降价主要是为了回应消费者期待,同时原材料价格、物流运输等客观条件也发生了变化。公司称,首批产品的出厂价与过去相近,未来将通过更稳健的经营策略支撑更轻量的成本结构。

    产品方面,首批 3 款雪糕均延续钟薛高此前的经典产品形态,继续采用标志性的瓦片形状,单支装,规格和克重与过去保持一致。配方和配料表也将沿用此前产品。

    :想起之前托尼请我吃的那次,还是 18 块钱一根。

    曝字节跳动完成 2.9 亿美元融资

    ( 路透社 ) 9 月 16 日消息,据路透社援引两名知情人士消息称,字节跳动从集团拆分 AI 制药业务 Anew Labs 后,完成了一轮 2.9 亿美元 ( 现汇率约合 19.51 亿元人民币 ) 融资。

    Anew Labs 总部位于上海,业务为利用 AI 进行药物发现。其中一名知情人士称,该公司在首次对外融资后估值达到 15 亿美元 ( 现汇率约合 100.9 亿元人民币 )。

    本轮融资由原红杉中国 HSG、IDG 资本和高瓴投资领投,五源资本担任联合领投方。其他投资者还包括高榕创投、春华创投、博裕资本,以及战略投资者 SBP Group 和国资背景的上海未来产业基金。由于融资信息尚未公开,知情人士要求匿名。字节跳动及参与本轮融资的投资者没有立即回应置评请求。

    :药物研发,最期待有成果的一集。

    OpenAI 拟进行新一轮融资

    ( IT 之家 ) 9 月 16 日消息,综合《金融时报》《华尔街日报》两家外媒报道,OpenAI 已就以 1.2 万亿美元 ( IT 之家注:现汇率约合 8.07 万亿元人民币 ) 估值进行新一轮融资与投资者展开了初步谈判。

    知情人士透露,本轮融资谈判由投资者发起,其是否成真、具体时间等都将取决 OpenAI 的上市规划。1.2 万亿美元的初步估值也可能在未来数月的谈判期间发生变化。

    :啥时候能上市啊?

    锅哥表示很急。

    跳转微信打开

    和Jeff Dean押注同一方向,27岁清华助理教授创业,两个月融资数亿

    文|王欣逸

    编辑|张雨忻

    今年,用AI自我改进AI,几乎成了海内外头部实验室的共识。

    近一年来,OpenAI创始成员Andrej Karpathy、前Meta FAIR研究总监田渊栋、前DeepMind...

    文|王欣逸

    编辑|张雨忻

    今年,用AI自我改进AI,几乎成了海内外头部实验室的共识。

    近一年来,OpenAI创始成员Andrej Karpathy、前Meta FAIR研究总监田渊栋、前DeepMind首席科学家Jeff Dean都相继加入RSI(Recursive Self-Improvement,递归自进化)创业的热潮。

    发生在RSI身上的,几乎是一个和世界模型高度相似的故事——即使是最先进的实验室,也没有探索出关于递归自进化的突破性成果,技术的不确定性,很快被宏大的叙事与火热的资本市场淹没。田渊栋就是一个典型的例子,今年5月,他所在的创业公司Recursive Superintelligence在还没有交出成果的时间点上,却已官宣完成6.5亿美元融资,估值推高至46.5亿美元。

    这股热潮也蔓延至国内。今年1月,就读于哈佛和MIT联合培养项目、即将博士毕业的陈勇超,正站在职业选择的岔路口:一边是DeepMind的工作邀约,以及多家专注做AI自动科研的海外初创公司抛来的联创橄榄枝;另一边,是他等了两年的创业Timing,恰好在此刻到来。

    他想做的是,训一个能自进化的通用模型,让它在一套能自进化的Harness之上,独立完成人类科学家在做的研究,包括构思想法、检索文献、跑实验。

    经过一系列的考量,他选择了后者,回国创立了超衍智能(Apex Intelligence),专注做自主进化的基模研发,并同步入职清华大学。

    27岁的陈勇超,成为了清华大学人工智能学院有史以来最年轻的助理教授,他在7月正式官宣创立的超衍智能,也在短短两个月的时间内完成了两轮亿元级融资。

    《智能涌现》获悉,近日,超衍智能已完成近4亿人民币天使轮及天使+轮融资。天使轮由IDG资本、星连资本、晶泰科技联合领投,德迅资本、无限基金、初心资本、云岫资本跟投,汇聚了头部美元基金、产业资本及市场化投资机构。天使+轮则由北京、深圳、上海三地头部国资——中关村科学城基金、深创投、上海未来产业基金联合领投。

    本轮融资将重点用于基础模型与算力基础设施的构建、递归自进化技术的研发投入,以及核心团队的扩张。

    这是一支由Researchers主导的创业团队,超衍智能创始人陈勇超曾在Google DeepMind、Microsoft、IBM等海外实验室做大模型相关研究,团队核心成员来自字节、Kimi、智谱等头部大模型厂商,有一线模型研发经历。

    不同于做Agent层的RSI,超衍不聚焦于做AI for Science的Harness和应用,而是探索基模层的递归自进化能力,让每一次研究任务生成的轨迹变成训练数据,用于改进模型,并进一步攻克更难的问题。

    在超衍内部,这套逻辑被概括为“Research is the engine of RSI”,即研究是递归自我改进的引擎。它的最终目标,是用一套递归智能系统连接数字世界与物理世界,将统一的能力拓展至AI、数学、物理、芯片设计、机器人、工业制造、化学、生物等各个领域。

    “Coding平权之后,下一波会是Research的平权。”在陈勇超看来,AI的自进化,正在成为现实。

    他手上的第一个有力证据,来自今年5月,他们让公司的自进化AI System自主产出了34篇论文,结果相当惊喜,这些论文提交到ACL Rolling Review(ACL系列会议的统一审稿平台)后,有11篇拿到了3分以上,这是一个不低于博士水准的初审分,其中,还有2篇论文的分数超过了99%的人类研究员。

    “很多想法都挺让人眼前一亮的,有些论文几乎达到了博士生水平,这在我们的意料之外,但也在情理之中,因为这个时刻迟早都会到来。”陈勇超说。

    论文之外,从AI自主进行AI方向的研究,到在数学等基础科学领域的探索实验,超衍的AI系统已在多个高难度研究领域完成初步验证。目前,公司内部已沉淀数万条高质量研究轨迹(Research Trajectories),涵盖专家轨迹、合成轨迹和AI自主生成的研究轨迹。

    △研究是递归自我改进的引擎,图源:企业

    如果要把智能的演进放在一个坐标轴上,陈勇超认为,它不是平滑上升的,而是沿着S型曲线,突破一个瓶颈、快速爬升、然后平缓,再等待下一个瓶颈。现阶段,我们正处在上一个属于Scaling Law拐点的平稳阶段,正在等待新拐点的出现,以及下一个智能快速爆发的时刻。

    陈勇超对这个拐点即将发生坚信不疑,“时代不可能等你,这和两年前不做大模型、一年前不做具身智能的情况是一样的,RSI在现在就是最好的创业时间点。”

    关于回国创业、选择RSI方向以及对智能演进的思考,我们带着一系列问题,来到了清华大学人工智能学院的办公室,与他展开了交流,以下是《智能涌现》和陈勇超的对话实录,略经摘编:

    模型的稳定性和创新性,是对抗的

    智能涌现:为什么今年RSI突然爆发了?

    陈勇超:很多人认为是模型能力到了瓶颈期,需要探索新路径,我觉得这是次要原因。最主要原因是,技术的转折点已经来临,模型已经强到一定程度,能够做很多人类研究员做的研究了。这也正是我们探索的方向,训下一代模型,让它能达到甚至超越人类研究员的水平。

    智能涌现:用简单的话解释,自进化的模型和现在的大模型有什么区别?

    陈勇超:现在的大模型是求稳的模型,给大众用、保守的、不想让它犯错的模型。比如,问它100个问题,它能回答出95个,剩下答不出来的问题努力让它减少幻觉,或者让它直接回答不知道。

    但自进化的模型是注重创新性的模型,它对稳定性要求不高。比如,你问它一个问题,它答不出来,但我们期待它能提出100种不同方法解决这个问题,其中99种错得再离谱都没关系,只要一种对就行。也就是说,探索过程中要允许大量方法失败,但只要其中一种被证明有效,系统就能识别它、保留下来,并且将这次成功转化为未来可以复用的能力。

    模型创新性和求稳性很多时候不可兼得,模型过于求稳保守,其创新性就会弱。有的时候我们甚至发现,模型通用的评测结果越好,创新性越差。

    智能涌现:要实现模型的自进化,关键的技术卡点在什么地方?

    陈勇超:第一是模型提出天马行空想法的能力;第二是自主执行能力;第三是验证能力。目前,模型能否提出好想法,筛选出好想法后自主执行下去并做好验证,是特别大的卡点。

    智能涌现:这些卡点可以通过什么方式来解决?

    陈勇超:模型的训练方法以及模型架构,尤其是上层架构,都要做一些调整,数据也有很大变化。比如,用一些对抗性的训练方法,让一个模型扮演不同的角色:既能提出好的想法,也能自行评估,判断这个想法在合理性、创新性上表现如何。通过迭代式的自我改进方法,让想法越来越好、创意水平越来越高。

    智能涌现:为什么先从科研场景先尝试模型自进化能力的落地?

    陈勇超:科研场景对聪明大脑的需求最为迫切。自进化本身是在追求智能上限,也就是对标甚至超越人类研究员。它通常会瞄准那些处于智能上限、最需要创新性的场景。

    智能涌现:AI for Science、AI Scientist、Auto-research和Recursive Self-improvement,这几个词之间是什么关系,有重叠吗?

    陈勇超:在我看来,RSI、Auto-research和AI Scientist虽然不是字面意义上的同义词,但本质上指向同一个目标,就是构建能够自主开展研究、并在研究过程中持续提升自身能力的通用研究智能。AI Scientist描述的是这种系统扮演的角色,Auto-research描述的是它自主完成研究的过程,RSI描述的则是它根据研究结果不断改进自身的机制。

    AI for Science和它们不在同一个概念层次。AI for Science描述的是AI被应用在哪里,即利用AI解决科学问题;它可以是一个科研工具、一个垂直领域模型,也可以是一个完整的自主研究系统,但并不必然具备自主研究和自我改进能力。

    尽管Auto-research和AI Scientist出现得更早,但很多做这两个方向的人把这个概念做窄了,Auto-research并不只是搭一个Agent写论文,AI Scientist也并不只是训练一个垂直领域的小模型。它们真正要解决的问题是,训练出一个通用模型来超越人类研究员,让AI成为人类员的Coworker。

    智能涌现:RSI可预见的上限是怎么样的,能达到什么样的水平?

    陈勇超:这取决于它最终能成为人类哪个level的研究员,这个很难讲它最终能到清华等顶尖高校博士生水准,还是牛顿、爱因斯坦水准。

    智能涌现:智能爆发式增长可能会出现在什么时候?

    陈勇超:我觉得会有一个拐点,可能会发生于模型在某些环节的效率比人高,或者创新能力跟人差不多的时候。它是按瓶颈和阶段推进的,某段时间一旦突破了一个瓶颈,就会呈S型曲线上升,先快速发展,之后逐渐平缓,那时你就会开始等待下一个能突破的瓶颈。

    智能涌现:现在智能处于什么阶段?

    陈勇超:第一个S型曲线是Scaling Law,现在正处于第一个S型曲线接近饱和的阶段。现阶段模型的迭代,其能力进步已经没那么快了,已经到了S型的上端。RSI可能是下一个S型,也可能是帮助发现许许多多S型曲线突破瓶颈的方法论。

    像人类科学家一样做研究

    智能涌现:从整体来看,你们现在在做的事情有哪些?

    陈勇超:我们做了一个做自动化科研的AI System,让它来做AI for AI、AI for Math,以及各个学科。同时,我们也在训练自己的大模型、建立能够评价大模型在研究领域能力的benchmark。

    智能涌现:这个自进化AI System独立完成一个科研项目,其端到端的过程是怎么样的?有没有具体的案例?

    陈勇超:这跟人类做研究很像,并且,它像人类科学家一样“全栈”,能自己动手做实验:自己构思想法、做实验、连GPU、搭建环境、训练模型,最后根据实验结果改进方法,并把成果总结成报告、代码仓库、产品或论文。

    比如,它现在能帮数学家发现数学上的重大突破、证明定理;也能做AI领域的事,自己优化AI训练里的内核、数据分布、算子;还能做机器人VLA的数据仿真与VLA架构改进。

    智能涌现:在这个系统中做一个项目的研究,周期一般是多长?相比人类做研究,它的速度能快多少?

    陈勇超:这取决于研究难度,难度比较大的项目,AI可能要做两三周,但相比人类已经非常快了,人类的话可能要做好几个月甚至一年。

    智能涌现:这个产品已经上线了吗?

    陈勇超:最近已经上线了,正在小范围内测中。

    △自动化AI研究系统原理,图源:企业

    智能涌现:关于你们现在正在训的模型,可以展开讲讲吗?

    陈勇超:首先,这个模型肯定是个大参数规模的模型。

    它跟上一代模型很大的区别是,我们注重创新性和研究能力。它可能在一些通用能力上,如编程、数学比闭源SOTA模型差一些,但在完整的研究能力上会显著更强。

    智能涌现:你们是从头开始训模型吗?

    陈勇超:我们现在还是基于开源模型做中训练和后训练,做预训练还需要更多的资金储备。

    智能涌现:现在你们的模型能达到什么效果?

    陈勇超:我们自己看下来,有的方面比较惊艳,比如在数据自进化、Harness自进化上,但目前只能做较小的优化,想要在创新性上做很大的突破还比较难。

    我们想先训一个通用的模型,它能做很多领域的研究,比如AI for AI、数学、机器人、芯片设计、量子。其中,通用模型的很多数据会包含各个领域,之后基于通用模型做微调,它也能在垂直场景中快速落地。

    智能涌现:为什么先做通用模型,再慢慢做各种垂直场景?

    陈勇超:很多领域的创新来源于毫不相关领域的启发,如果你只用垂类领域的数据训模型,它可能在局部任务上越来越强,但整体智能反而会下降,也就是我们常说的“灾难性遗忘”。

    比如,我想让它做AI for大模型,让它所有的训练数据、研究轨迹,全都来自AI自己训大模型的领域。结果你会发现,它就可能逐渐过拟合这一分布,遗忘原本具备的数学、物理、化学乃至常识推理能力。如果它连常理都能忘掉,智力就会退化,它可能越来越擅长重复已有的大模型研发范式,却越来越难跳出局部最优,产生真正具有突破性的新方法。

    智能涌现:你们最近还发了一个Benchmark,叫ASI Bench。

    陈勇超:��的,这是一个评价模型探索能力和研究能力的Benchmark。ASI和AGI的最大区别是,ASI能探索模型提高智能上限、探索世界未知知识。现在还没有一个很好的Benchmark来评价模型的探索能力和研究能力,所以我们做了这个。

    智能涌现:和RSI直接相关的数据非常少,你们如何突破呢?

    陈勇超:数据是一个非常核心的问题。无论是研究类数据,还是递归数据、Auto-research数据,这些都和大模型的数据不同,它需要的是一条完整的研究轨迹数据。

    这种研究轨迹非常难获得,因为它都散失在研究过程中了。大家最终留下的往往只是报告、产品、论文,那只是结果;而中间试错、成功与失败的过程轨迹,是根本没有保留下来的。

    不仅如此,最顶尖的研究员、人类科学家那些“灵光一现”的时刻,很难被数字化地记录下来。比如王虹证明挂谷猜想,基本就是今天想一些、睡一觉,明天再想一些、再睡一觉,想要记录下整条思维链非常难。我们也在做这方面的探索,尝试把它复刻出来。

    智能涌现:这么说,让AI改进AI自身,其实也是在模仿人类自我改进的过程。

    陈勇超:对,最聪明的人往往都会自我进化、自我迭代,通过与外部反馈、与自己、与世界互动,来不断提升自己。我们要模仿的,就是这个过程。

    一条研究轨迹包含很多内容:怎么构思想法、处理信息、搜集信息、执行实验,以及如何根据实验结果来调整下一步计划。

    智能涌现:关于把研究轨迹数字化,你们做了哪些探索?

    陈勇超:我们在构建领域专家生态,邀请各领域专家一起合作,请他们尽可能复现他们的研究轨迹,并用AI可以理解的方式无信号损失的记录下来。目前行业里基本还没有这一类完整研究轨迹的数据。我们目前已有的数据包括:与专家合作构建的数据、AI合成数据、以及用户自愿选择分享的产品使用数据。

    智能涌现:训一个模型需要多少量级数据?

    陈勇超:这个说不好,数量上很难用“多少T”来衡量,因为一条数据本身就包含很多步骤、很多轮交互。更合理的衡量方式,是按项目数量,或按轨迹的数量与长短来评估。

    只做Harness层的商业化,很容易被模型吞掉

    智能涌现:你从2月份做RSI到现在差不多半年了,从当时非常坚定地入场,到现在为止,你的体感怎么样?

    陈勇超:不管在技术上还是资本市场上,当时的想法都得到了验证。

    我的判断依然很坚定,第一代大模型(如ChatGPT)替代白领,具身智能替代蓝领,而ASI将替代人类科学家,也就是那些拥有博士学位、“最贵也最聪明”的一批人。

    智能涌现:你们在商业化上有什么思考?

    陈勇超:Harness层很容易被模型本身吞掉。只做Harness层的商业化,即只提供一套能自动科研的系统,其上限非常明显。因为模型训练到足够好之后,它可以自己优化自己的Harness。

    我们团队最初把Harness自进化和模型进化放在一起做,很明显发现,Harness自进化做到一定程度以后就无法更进一步了。

    智能涌现:目前你们的自进化AI System的商业化还没有起步,感觉你们并不急于商业化?

    陈勇超:从上一代模型中我们就可以看出,一开始过多考虑商业化会很拖累模型训练的研发,考虑的越多,精力越被分散。我们希望更聚焦,把大量的精力和人力投入在我们研究型基础大模型训练中。

    智能涌现:你们设想的商业模式是怎么样的?

    陈勇超:我们本质上还是个基础模型公司,因此我们的商业模式本质上还是卖Token,只是Token的形式可能会是API、可能会是一个类似Claude Code一样的半成品、也可能是一个以解决方案呈现的Token集合。便于大家更好的理解,做个类比,Claude Code是Vibe Coding,我们的自进化AI系统是Vibe Research,卖模型以及Harness,让用户可以基于这个系统做各种研究。

    智能涌现:今年你们有什么目标吗?

    陈勇超:我们的自进化AI系统会上线,顺利的话,年底或明年年初会发第一版模型,这个模型在研究方面会全球领先,同时,在某些高价值领域实现落地。

    智能涌现:这个模型会开源吗?

    陈勇超:可能会,还没有最终确定。

    智能涌现:你之前说可能还会推出其他产品,他们会是什么样的呢?

    陈勇超:我们现在的产品基本有两类,跟ChatGPT类似:一类是aPaaS(低代码平台),另一类是像Claude Code这样的CLI(命令行)端。其中,第一类正在推向更多人使用,第二类可能要等模型出来之后才会上线。

    智能超过人类的时刻,早晚会到来

    智能涌现:你是什么时候发现这一代模型已经能达到人类研究员的水平了?

    陈勇超:今年5月份,我们有一天突然发现,我们搭的自进化AI System生成的一些想法还挺让人眼前一亮的,生成的论文差不多能达到清华博士的水准了。比如,当时AI提出了一个挺有意思的想法:基于VLM来训练VLA,和自己端到端从头训练,两者是不一样的,在最后的编码器和解码器空间上,在特征上会产生很大的差异。

    当时我们让这一系统生成了三十四篇论文,提交到了ACL Rolling Review(ACL系列会议的统一审稿平台)中,其中有11篇拿到了≥3分的初审分,这个分数意味着,这些论文可能会被Findings(ACL的论文集)接收,也可能被收录进主会。其中,我们还有两篇论文的分数,超过了99%人类研究者。

    智能涌现:这个结果在你看来是意料之中,还是意料之外?

    陈勇超:拿到结果时我非常意外,但意料之中的是,这个时刻早晚会到来。

    智能涌现:目前有像你们一样拿到实质性结果的公司吗?

    陈勇超:在ACL Rolling Review上拿到这么高分的,全球范围内只有我们一家。

    智能涌现:你之前有提到,利用你们的自进化AI System在数学领域改进了一项沿用十余年的结论,这具体是什么?

    陈勇超:我们和清华大学交叉信息研究院的张景昭老师开展的一个合作,用我们的系统探索一些有意思的数学问题。

    智能涌现:人人都能做研究,这会在什么时间点实现?

    陈勇超:和Vibe Coding一样,Coding能力经历了一系列变化:从给高级码农用,到给初级码农、普通人用,再到现在几乎不需要人,AI自己就是一位高级码农。

    AI自动做科研现在所处的阶段是,能帮助非AI专业的本科生发AI领域的A会论文,让本科生达到博士生的科研能力,也能在数学物理等领域发现一些人类觉得比较有价值的研究,但是想要AI实现那种创新性重大突破还有不少距离。

    智能涌现:RSI在未来的发展有哪些节点?

    陈勇超:首先,让AI接管那些纯粹在电脑里就能完成的研究,之后,不断扩大AI能覆盖的范围:一边延伸到更困难的计算任务;另一边,延伸到需要在真实实验室里动手做的实验,比如生物实验、材料实验。

    总而言之,在广度上,它要成为各领域的专家;在深度上,它可以去攻克那些人类花很多年都做不出来的难题,比如数学领域,突然发现一个百年都未能证出的定理。

    RSI的Timing,已经到来

    智能涌现:你本科在中科大,主修理论与应用力学,博士又去哈佛、MIT,做各种各样的方向,最终为什么要回到AI这个领域了?

    陈勇超:这是一段漫长的探索。我小时候的梦想是做基础科学、当科学家。从本科大二就开始进实验室做基础科学的研究,一直到博士的博一,我转了很多方向,比如力学、金属材料、核聚变,还有AI for Science。我给自己定了个规矩:每个方向都要做出比较好的一作的论文,再换其他的方向。本科时期的论文和研究成果,已经足够博士毕业。大二的研究课题,我以共同一作发了Nature Communications。

    在大四的时候,在MIT暑研的导师特别看好AI for Science方向,我就去做了,那个时候大模型还没有出来。当时我发现做AI for Science最大的问题是数据,只有好数据能训出好模型,而且当时模型的泛化性特别差,任务或者场景稍微改动一些,它的能力就会变得非常差。

    因为机缘巧合,我在哈佛的第一年开始做机器人的强化学习;之后就一直在做大模型相关的研究。当时并没有Recursive这个词,但我们已经经常运用自进化的思想做研究了,比如,让AI自己来优化自己的提示词、数据分布以及训练算法。

    智能涌现:为什么说经过这么多转折,最后确定了RSI这个创业方向。

    陈勇超:以前不做这个方向,是Timing没到。

    我做Recursive Self-Improvement这个方向很早,2022、2023年的时候我的大部分研究就已经引入了RSI的很多理念,比如数据自进化、模型通过实验结果优化下一轮的实验参数、大模型自主训小模型等等,只是那个时候大家用的还不是RSI这个词。

    真正让我发现它在产业界有很大价值,是我2025年在谷歌DeepMind做研究的时候,当时就在做Auto-research,我的Leader想让我优化整个Auto-research Pipeline。当时我对这个方向有顾虑,觉得那个时候模型还没那么强,做不出来人类觉得特别好的研究。

    智能涌现:后来你看到了什么样的现象让你觉得模型能力已经非常强了?

    陈勇超:今年2月,Claude Opus 4.6发布。我发现能够做出来一些人类觉得有价值的研究。

    它的能力是一种若隐若现的朦胧感——它有很多能力让你觉得很惊艳,有很多能力让你觉得很不足。但正是那些惊艳能力,让我觉得这个方向很值得进一步做,而且是创业公司很好的机会。

    当时我们发现,在独立完成从提出问题到得出结论的研究过程中,如果用一些开源Auto-research产品接入模型,表现都不理想。但给模型一个足够好的Harness,或者足够多的提示词,模型就能把很多任务完成得很好,甚至具备一些人类科学家的能力。

    智能涌现:你是什么时候打算创业的?

    陈勇超:两年多前。

    智能涌现:为什么那个时候想创业?

    陈勇超:有两个方面的原因,一方面是我慢慢发现AI的研究只能靠去大公司,或者自己创业,才有机会做出很有影响力的东西,另一方面是我遇到了很多也有创业想法的Researcher,时不时会一起碰撞对下一代大模型的观点,我当时的想法是,RSI是LLM和具身智能以后的第三波大机会,RSI需要训一个通用的跨领域模型,需要有很多模型训练的经验,以及跨领域的科研背景,这和我的个人经历是高度匹配的,果断决定All in创业。

    智能涌现:DeepMind的offer,以及一些公司的联创邀请,你都拒绝了,做这些决定的时候内心有没有挣扎?

    陈勇超:今年1月份,我挣扎了一个月。很多offer开的薪资很高,位置也很高,有些也挺诱人的。

    很多人给我建议,在DeepMind待一两年再出来创业可能会更好。但你等不了,时代不可能等你,这和两年前不做大模型、一年前不做具身的情况是一样的,RSI现在就是最适合开疆拓土的时间点。

    智能涌现:有哪些外界的声音,或者你自己个人的判断,认为自进化一定是第三波的机会?

    陈勇超:只听外部声音是不准的,你需要自己去感受。二月的时候,我们搭了早期的自进化AI系统,搭上前沿模型,发现它已经能产生一些比较有实际生产力价值的成果了。

    不仅如此,我们认为,仅通过Scaling Law是没办法让模型实现做创新性研究的能力,上一代模型和RSI的模型也完全不同,这是OpenAI和Anthropic难以垄断的方向。

    智能涌现:为什么选择回国创业?

    陈勇超:前期有很多人给我建议,提到过三个地方:中国、美国、新加坡。

    从RSI创业角度来说,在哪个地方更重要、更有发展,我觉得是中国。

    图片来源|企业供图

    欢迎关注

    欢迎交流

    本文来自微信公众号“智能涌现”,作者:王欣逸,36氪经授权发布。

    英伟达带动AI数据中心大变革,中国厂商不想当边缘人

    美国宾夕法尼亚州的居民,在AI爆发时,可能会有很多抱怨。因为过去7年,他们的平均电价上涨了近50%。

    AI数据中心被称为电老虎,因为一个峰值需求为1千兆瓦的数据中心,吞噬的电量相当于大约70万户家庭的年用电...

    美国宾夕法尼亚州的居民,在AI爆发时,可能会有很多抱怨。因为过去7年,他们的平均电价上涨了近50%。

    AI数据中心被称为电老虎,因为一个峰值需求为1千兆瓦的数据中心,吞噬的电量相当于大约70万户家庭的年用电量,约等于一座小城市。一个1吉瓦的数据中心耗电量相当于一个中等规模的国家。

    但趋势无可阻挡。OpenAI总裁山姆·奥特曼蹭表示,如果AI算力未来20年增加1万倍,它对能量的需求也会增加1万倍。

    AI公司正在全球动工功率更大,性能更高的数据中心。2025年5月,英伟达宣布推出高密度算力平台Kyber机架架构以及800V供电架构。这是为未来吉瓦级AI工厂设计的方案,力图最大限度提升GPU的密度。

    这是AI爆发时代的新型数据中心。英伟达将其定义为一场“架构的根本性变革”。变革的核心可以概括为两点: 传统数据中心机房通常采用480V交流电进柜,并在机柜内降压整流为54V/48V直流电给服务器供电。英伟达则采用800V高压直流(DC)直接入柜,彻底取代传统的54V DC母线。

    根据英伟达官方技术文档,从415V交流切换至800V直流后,相同尺寸的导体可多传输85%的功率,并使铜缆需求量直接砍掉45%;同时,通过剔除传统链路中多次无谓的交流-直流转换环节,可以显著提升系统整体电能利用效率,也是支撑单机柜功耗从100kW向兆瓦级迈进的重要解法。

    无数供应商主动或被动地卷入了这场AI基础设施巨变中。英伟达合作商名单里,除了伊顿、英飞凌等老牌欧美巨头,也不乏英诺赛科、麦格米特等土生土长的企业。

    不可否认,虽然少数企业进入了英伟达供应链,国内很多公司的技术短期内和欧美企业仍有差距。一位深耕电力电子行业多年的企业CTO告诉硬氪,他判断这个差距需要3~5年的追赶。

    但另一面,国内智算中心建设与国产算力芯片的跟进,依然释放出了本土市场需求。硬氪采访的一家较早做兆瓦级SST的企业创始人表示,该技术此前在工业领域关注度并不高, 最初只有一两家国内做微电网、闪充的企业关注兆瓦级SST方案。但自2025年下半年以来,随着智算中心的发展,行业开始铺开,公司累计已接洽了两三百家意向客户,“都是国内企业”。

    在二级市场,半导体板块持续走升,SST和氮化镓等概念相关企业行情也十分火爆。2026年上半年,有20家储能相关企业已推出27款SST新品,中信建投等机构亦明确看好SST产业化趋势。

    如果想在未来的数据中心电力供应体系中占据一席之地,按照研发到供应链创建的周期推演,留给企业的时间并不充裕。“现在虽然是行业发展初期,但已经是必须入局的关键节点了。”一位长期关注AI Infra的投资人告诉硬氪。

     

    新架构下的三次变电重构

    要建成适应兆瓦(MW)级算力的大型数据中心,电力供应需要经历从发电端、输电端、储电端到变电端的全链条重塑,其中变电端的影响最为深远。行业之所以在庞大的配电链条中重点关注固态变压器(SST)、碳化硅和氮化镓这三者,是因为它们代表了这场800V直流电革命中最核心的能量转换点。

    具体来看,从电网高压电到最终注入GPU芯片,电力在数据中心内部需要经历三次核心变电:

    一次电源是指几千伏的市电通过变压器转换为800V高压直流,这是数据中心配电的起始环节。

    固态变压器在此发挥关键作用,它直接取代了数据中心大门口数吨重、占地几间房的传统工频变压器,将10kV/35kV交流电转换为800V直流母线,体积比传统变压器缩减50%以上。而SST之所以能在万伏高压和兆瓦级大功率下不被击穿,碳化硅强耐压、耐高温和高导热的物理特性提供了关键支撑。

    二次电源发生在机柜处,800V直流进入机房,在靠近机柜处转换为54V/12V,以机柜电源的形式存在。而氮化镓开关速度快、高频损耗低、可以缩小磁性元件。

    三次电源则是54V/12V电源送入服务器主板,进一步转换为1V左右的超低电压,直接为GPU/CPU核心供电。

    如果继续采用传统的低频硅基器件,800V高压带来的庞大体积与发热情况将使机房不堪重负。从技术演进来看, SST并非全新的物理原理,此前曾用于新能源汽车超充与轨交科研。但将其大规模引入数据中心供电,却是一个刚刚走向商业落地的新尝试。

    这种应用场景的切换,也改写了半导体行业的竞争格局。以碳化硅、氮化镓为代表的第三代半导体相比以硅为代表的传统半导体材料具有更高的耐压、耐高温和高频工作能力,尤其适合新能源汽车、光伏储能、5G通信等应用,是新一代功率半导体(功率半导体是指用于电能转换、传输和控制的半导体器件,比如IGBT、功率二极管)的重要材料,但多年来受制于成本和技术一直没有得到大规模应用。

    半导体业内人士陈瀚向硬氪回顾了过去多年行业的变化:2021年行业经历缺芯涨价潮,国产功率半导体获得了试错与选型入局的机会;2022至2023年,因产能过快释放引发去库存,中低端器件陷入惨烈的价格战,厂商盈利堪忧;直到2024年库存去化出清,行业开始向车规级等高品质产品突破。

    随着新一代电力中心的推进,功率半导体终于能跳出过去的恶性竞争。

    “2025年底之前,大家普遍觉得三代半导体很难做,新能源汽车端卷到了毛利为负的死胡同”,投资人袁越告诉硬氪。在很长一段时间,投资人已经抛弃了这个赛道,但2025年下半年AI算力暴增,功率半导体从新能源汽车和传统能源转到了AI数据中心供电领域,功率半导体重新回到舞台之中。

    “看这个赛道的投资人,本质上都是在投AI Infra。”袁越总结道,“大家沿着算力产业链一直在找机会——第一波投了GPU,第二波投了存储和CPU,再往后投了交换机、液冷、PCB,现在轮到了电源与电力基础设施。在这个指数级增长的行业里,供电系统的物理升级才刚刚拉开序幕,本土产业链的爆发只是时间问题。”

     

     “高压心脏”的信任壁垒

    需求虽然火爆,但从产业链现状来看, SST与第三代半导体的技术还未到成熟期。国内公司技术水平仍然和海外巨头有差距。

    目前国内从事SST研发的企业,主要由传统变压器厂商和原新能源汽车器件厂商跨界而来。但多位受访投资人强调, SST的技术门槛较高,汽车产线的经验并不能完全复用。

    以关键的碳化硅器件为例,单个碳化硅晶体管的耐压上限有限,高压下必须串并联使用,但目前国内单个器件的良率和一致性仍有不足,直接影响了整体系统的可靠性。

    受益于过去几年新能源汽车在碳化硅产线上的大力建设,国内碳化硅产业链已经相对成熟。但陈瀚告诉硬氪,虽然参与者众多,能实现盈利的凤毛麟角——一方面是渗透率尚在提升期,另一方面是国产集中在中低端市场,内卷严重,高端市场仍是海外巨头占据着主导地位。

    同时,新技术还面临着极高的“信任门槛”。关注半导体多年的投资人李成比喻称,“换SST就像做换心手术,没有数据中心敢轻易尝试。SST一旦出问题,整排甚至整个机房的昂贵GPU都会跟着瘫痪。”

    这也解释了为什么目前许多数据中心依然在沿用传统的绕线圈变压器进行“修修补补”,虽然笨重,但可靠性经受了数十年验证。数据显示,2026年1-4月,中国传统变压器总出口金额已达到217.7亿元,同比增长27%,出口金额连创新高。

    “趋势是不可逆的,当单芯片和单机柜功耗继续往上走、传统变压器物理上塞不下的时候,大家不得不换。”李成补充道,“只是国内目前绝大多数智算中心的单柜功率,还没飙升到非换不可的临界点。”

    除了半导体外,在李成看来,作为电力落地“最后一米”的服务器电源(PSU)与电源架也许还有些机会。

    据Valuates Reports统计,全球AI服务器电源市场规模将从 2024 年的 28.46 亿美元增长至2031年的608.10亿美元,年复合增长率(CAGR)高达45%。功率密度的数量级飞跃,意味着 PSU 不再是传统的低毛利开关电,而是集成了高频电路、液冷散热与微控制器的核心系统,硬件单价与盈利能力也将大幅度增长。

    从竞争格局来看,高端电源市场长期由欧美老牌巨头把控, “但中国电源产业的优势并不在于已经掌握800V电源的最高端技术,而在于完整的电力电子供应链、强大的制造和工程化能力,以及新能源产业多年积累形成的高压应用经验”,李成判断。

     

    挤不进的英伟达供应链与未来市场

    在英伟达披露的800V合作伙伴名录中,大陆企业凤毛麟角,像英诺赛科、麦格米特,主要通过氮化镓器件和电源模块合作切入。

    据投资人透露,英伟达的供应链通常需要提前两年锁定:企业首先需要具备可演示的硬件Demo挤进候选名单;Demo验证通过后,英伟达还会发起严格的审厂流程,对其制造工艺、上游供应商稳定性、月产能以及晶圆良率进行全方位考量。

    即使审查流程繁琐,全球硬件厂商依然趋之若鹜。核心原因在于极高的溢价收益——“英伟达供应链给供应商留出的毛利率普遍在60%~70%,而国内普通电源供应链的毛利率往往只有20%~30%。”

    除审厂门槛外,更加坚固的是地缘政治与安全信任所带来的壁垒。对于数据中心最干系民生和安全的强电基础设施,北美数据中心仍然很难接受国内公司。

    这也导致国内企业如果想出海,往往需要通过新加坡等中间转接,或者退居二线提供零部件代工,极难直接以整机品牌渗透。

    那么,进不去英伟达供应链,国内SST与三代半导体企业的机会在哪里?

    多位投资人表示,虽然绝大多数国内初创企业短期内难以触及海外顶级算力链,但华为昇腾以及寒武纪、摩尔线程等国产GPU芯片的演进同样迅速。随着国产芯片功耗不断走高,本土智算中心同样会面临供电的问题。国内电源与半导体企业可以和他们合作,预先绑定本土头部芯片与服务器大厂,一起预研下一代800V供电方案。 

    另一方面,国内的衬底产业链带来了较大成本与规模优势。虽然在高端器件设计上与欧美存在差距,但中国拥有全球最庞大、最成熟的碳化硅衬底与外延产业链,比如天岳先进、三安光电等。如果未来要规模化落地,碳化硅、氮化镓期间的降本是关键。

    今年下半年,作为英伟达800V高压直流电源架构的首批落地应用场景,Rubin系列将正式批量发货并上线提供服务。其摸索出的标准,实际的应用情况也将指导整个行业的方向。对于国内许多半导体和电源企业来说,他们要等的东风其实并不遥远。

    本地该怎么做RSI?我们与StartLux CTO聊了聊

    原创 关注RSI的 2026-09-16 12:00 四川

    RSI 不一定要发生在云端

    编辑|Panda

    上周六,陶哲轩、邓煜、彼得·舒尔茨等 25 位菲尔兹奖得主联合发表了一份声明《人工智能在数学...

    原创 关注RSI的 2026-09-16 12:00 四川

    RSI 不一定要发生在云端

    编辑|Panda

    上周六,陶哲轩、邓煜、彼得·舒尔茨等 25 位菲尔兹奖得主联合发表了一份声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩还表示「事态紧迫」,他们根本没有时间等待更广泛的协商就决定先行发布。

    这封信并不反对 AI 进入数学,而反对的是 AI 公司把「攻克著名难题」当基准来刷。这样一来,数学共同体真正在意的理解、概念和可被后人复用的思路,正在被一个更容易量化的目标挤掉。

    而就在此三天前,OpenAI 刚刚宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时 88 小时,完成了纳维-斯托克斯存在性与光滑性问题中部分陈述的证明,并表示不申领克雷研究所的奖金。

    社区讨论中,一大核心论点是 OpenAI 的模型到底有没有「盗窃」数学家的思路,然后依托强大算力抢先证明。也因此,前沿数学研究可能会开始防备云端 AI 提供商

    但要真正做到,却又很难,毕竟本地 AI 能力不够强。你可以把未发表的推导锁在自己的硬盘里,但那意味着你也放弃了那个真正能帮上忙的强大云端模型。所以过去几年,绝大多数人还是把稿子交给了云端。

    而这个前提,正在出现松动的迹象。时间往前拨半个月。工信部中国信通院人工智能研究所公布的检验报告显示,中国初代程序员、盛大网络、连尚网络创始人陈大年创立并担任 CEO 的上海原点星辉科学技术有限公司下简称 StartLux,其本地模型 StartLux-V1.0-27B-Preview 在可信 AI 大模型基准测试 MCP 专项测试中综合得分 39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731,与 1.6 万亿参数的 DeepSeek-V4-Pro 差距在 1 个百分点上下。

    参数量差约 60 倍,这个对比很容易被写成一个爽文式的标题——我们也确实看到了一些这样的报道;但作为一家专业的 AI 媒体,我们更想追问的是这 39.25 分是怎么来的:同样是 27B、同样以 Qwen3.6-27B 为基座、结构基本没动,它比基座本身高出 5.34 个百分点,增量全部发生在后训练环节。

    据 StartLux 团队透露的数据,这个环节里约 70% 的实验执行工作是交给 AI 完成的,研究员保留研究目标、评价标准和关键取舍。团队把这套方法叫 Auto Research

    顺着这条路往下,指向的是一个更广阔的研究方向:RSI(递归自我改进)。9 月 6 日,OpenAI 发布了一篇自我披露博客《Research acceleration: The view inside OpenAI》。里面有一个相当惹眼的数字 3.1:截至 8 月中旬,它的研究组织每消耗 1 个人类工作日,就要配上 3.1 个 Agent 工作日的算力运行时间。该公司 7 月还曾因 Agent 突破内部研究基础设施而暂停强化学习实验两周。OpenAI 表示:「我们还不知道如何安全地一路走到对齐的、完整的 RSI。」

    就这样,RSI 成为了近期产业讨论一大核心,但相关示例几乎全部来自最烧钱的那几家云端实验室,还很少有人讨论本地的、跑在你自己电脑上的模型的 RSI。

    StartLux 想做的,是把这条路线的产物装进一台个人电脑。But how?

    StartLux-V1.0-27B-Preview 正在个人电脑上执行金融分析任务

    我们把这个问题交给了 StartLux 联合创始人兼 CTO 郭权玮博士

    StartLux 联合创始人兼 CTO 郭权玮博士

    在这次专访中,他把自我改进划成了五级,并给出 StartLux 目前所处的位置;他提到「70% 实验执行」这个说法容易让人误解,若只算机械执行,今天的自动化比例已超过 95%;他还公开了一组量化实验数据,Q4、Q6、Q8 与 BF16 的差距小到出人意料,Q2 才是真正的悬崖;他也拿出了一组「能力重新分配」的实测数字,一轮针对 Agent 的后训练让 GPQA 从 83.33 涨到 90.40,同时让 GAIA 从 57.57 掉到 45.70。至于「本地 × RSI」绕不开的安全问题,他也给出了重要见解:探索的自由和修改自己的权限,必须分开。

    整体而言,StartLux 与郭权玮博士想做的,是让 AI 作为「每个人自己的模型」而进化——它会在你的机器里成长,用你的文件和你的成功/失败变强,构建只属于你的进化轨迹。

    下面,我们就跟随郭权玮博士,详细了解一下 StartLux 这家创业公司是如何走出了属于自己的「本地×RSI」之路。

    亮眼的成绩单意味着什么?

    机器之心:在工信部中国信通院人工智能研究所公布的检验报告显示,StartLux-V1.0-27B-Preview 在 MCP 专项测试中综合得分 39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731,与第一名差距也不大。这个成绩意味着什么?

    郭权玮我一直把一个模型理解成一个高维世界。参数量决定了这个世界大致有多少容量,但真正决定它能表达什么的,不只是世界有多大,而是里面的结构如何组织

    训练会不断改变这种组织方式。一个能力变强,有时不是因为模型获得了更多参数,而是有限的参数被重新组织到了更有效的位置。与此同时,不同能力之间也会产生干扰和竞争,所以后训练真正困难的地方,是如何在有限容量下重新塑造能力分布,同时尽量不破坏原有能力。

    我们做 Auto Research,本质上是在尝试把这种「寻找更好参数组织方式」的过程自动化。现在的结果说明,模型规模不变,能力分布仍然可以被明显重塑;如果这种过程以后能够由 AI 自己持续完成,那就开始自然走向 Self-Improvement,甚至更远的 RSI。

    机器之心:Agent benchmark 的成绩很容易受 Harness、Prompt 和执行配置影响,行业里 reward hacking 的案例也越来越多。你们内部怎么判断一次改进是「真的变强」,而不是「学会了钻评分规则的漏洞」?回头看 MCP 测试那 5.34 个百分点,你们最看重它证明了什么?

    郭权玮:现在几乎每隔几天就会有一个新模型,尤其是后训练模型。Benchmark 当然重要,但它本质上还是一张考卷:分数变高,可能是真的学会了,也可能只是更熟悉这类题。

    所以我们内部其实没那么在意 5.34 这个数字本身,更在意的是同一套后训练方法放到不同 Benchmark、不同任务上,提升还能不能持续出现。目前看,这套方法是成立的。

    但我自己对「真的变强」的标准会更高。不是在现有评价框架里把分数继续往上推,而是模型内部的能力组织发生更一般的变化,让这种提升能够迁移到新的任务和环境

    我们现在也在尝试新的后训练框架,让训练不只调整参数,还能进一步探索对模型结构本身进行受控改变。目标不是让模型越来越会做题,而是让模型获得新的能力。

    机器之心:官方说 16GB 以上显存的消费级显卡就能跑,比如 RTX 4060 Ti 16G。但 27B 模型在未压缩的 BF16 精度下,仅模型文件就需要约 55.6GB 显存。如果要进 16GB 显存,必然涉及量化。信通院送测的是哪个精度的版本?从送测版本到用户实际能装到电脑上的版本,MCP 这套任务的成绩会下降吗?

    郭权玮:信通院送测的是未量化版本,当时我们想先把变量尽量收干净,27B 这一轮主要验证的是 Auto Research 到底能不能真实提升模型能力,量化则是另外一条实验线。比如在 Qwen3.6-35B-A3B 等模型上,我们测试了不同精度,在 AppWorld、APEX-Agents、SpreadsheetBench、OSWorld 四个任务集上,每个版本一共 1209 道任务。一个比较有意思的结果是:Q4、Q6、Q8 并没有随着位宽下降出现明显的线性能力损失,整体都非常接近 BF16;真正明显的风险是在继续压到 Q2 以后。Qwen 的 Q4/Q6/Q8 相对 BF16 聚合波动只有 -0.1~+0.2 个百分点,Q2 才下降 1.3 个百分点;Gemma 的 Q4/Q6/Q8 为 -0.7~+1.6 个百分点,Q2 则下降 3.4 个百分点。

    从目前的实验看,合理的量化并不必然带来明显的能力损失。16GB 能跑不是单靠量化,而是量化和推理系统一起优化的结果。我们一直保持比较快的迭代节奏,近期也会推出自己的量化方案。我们的目标,是让个人设备持续承载过去只能依赖云端的高性能 AI 能力。

    StartLux-V1.0-27B-Preview 正在个人电脑上执行浏览器自动化任务

    Auto Research 实践细究

    机器之心:亮相之后,外界对「70% 实验执行交给 AI」这个数字有不少讨论,也有疑问。能否系统讲一讲:70% 是怎么统计出来的,分母是什么?剩下的 30% 具体是什么?从项目启动到今天,这个比例经历了怎样的变化?另外,它与 OpenAI「3.1 个 Agent 工作日」的差异点是什么?

    郭权玮:后来我们发现,「70% 实验执行」这个说法其实容易让人误解。如果只算生成配置、启动训练、跑 Eval、整理结果这些机械执行,今天自动化比例已经可以超过 95%。70% 更准确地说,是整个实验研发链路里,有多少研究与决策环节已经有 AI 专家参与。

    这里的 AI 专家也不只是大语言模型。不同参数规模、不同后训练方式的模型会形成不同的决策偏好,舉例來說,可能还有预测模型、判别模型和我们自己设计的算法共同参与。剩下主要还是研究目标、评价标准、系统规则以及大的方向判断。

    而且 70% 已经是比较早期的数字,我们的系统一直在快速迭代。OpenAI 的 3.1 个 Agent 工作日衡量的是 Agent 实际投入了多少运行时间;我们的 70% 更接近 AI 对研究决策链的参与程度,两者不是一个指标。OpenAI 自己也特别指出,高层研究规划目前仍只占 Agent 输出很小的一部分。

    机器之心:你们给 Auto Research 划的分界线是「AI 能不能根据上一轮实验结果,自己判断下一步该研究什么」。目前这个闭环里,哪一环已经完全交给 AI,哪一环还必须人来把关?能否用一个具体实验走完全程,比如金融分析场景里「回查原始数据 → 确认目标条件 → 再计算」那批任务,从失败轨迹被捕捉到新训练数据入库,中间发生了什么?

    :现在几乎完全交给 AI 的,是规则确定之后的执行;真正还没有完全交出去的,是规则本身怎么产生。

    比如金融任务里,我们发现模型会直接计算,却没有先回查原始数据和确认目标条件。系统捕捉到这类失败以后,不是人工去一条条标数据,而是先由不同 AI 模型判断失败原因,再产生多个改进假设:是数据问题、推理顺序问题,还是训练方法问题。然后系统预测哪些方案更值得实验,自动构造针对性数据、启动训练、重新 Eval,并检查其他能力有没有退化。

    实验结果会再次进入系统,成为下一轮决策的依据。所以我们的分界线一直不是 AI 会不会跑实验,而是实验结束以后,它能不能决定下一步值得研究什么

    机器之心:公开报道只说 Research Agent 用的模型「可以比被训练的 27B 更强,也可能由多个模型共同工作」。能否多透露一点:是单一强模型还是多智能体分工?为什么不一鼓作气用最强的模型把研究全自动化,瓶颈在能力、成本,还是安全?

    郭权玮:更准确地说,我们做的是多模型的异构协作,而不只是几个大模型 Agent 在一起讨论。

    一个模型训练完成以后,会形成比较稳定的决策偏好和误差结构。可以把它想成不同研究员:同一个实验,A、B、C 很可能会有完全不同的判断。我们反而希望保留这种差异,再通过算法决定哪个判断更值得相信。

    所以不是所有问题都扔给最强的大模型。综合能力最强,不代表每一个决策点都最准确,而且让同一个模型同时提出假设、评价假设、再决定自己对不对,很容易产生相关性很高的错误。

    Auto Research 不是把一个最强模型无限放大,而是研究怎么把不同的 AI 组织成一个研究系统。越来越多的 Auto Research 研究正在证明我们的思路是对的与其信任一个最强模型的能力,不如让不同模型各司其职,后者的结果反而更好。因为最强模型确实容易陷入局部最优,钻牛角尖;而多个模型拥有不同的思维模式,当它们能够相互进行有效批判时,就更容易产生更优解。这也正是我们认为本地模型才能实现 AGI,而单一最强模型无法实现 AGI 的原因。

    机器之心:你们特意区分了 Auto Research 与知识蒸馏,强模型当研究员而不是老师。但在实际工程里,怎么防止流程悄悄滑向蒸馏,比如 AI 生成的数据本质上就是某个强模型的答案?有没有可执行的检验机制,能证明这一轮的增量不是来自模仿?

    郭权玮:我觉得这里最重要的区别是:不是看数据是不是 AI 生成的,而是看「正确答案」由决定

    如果强模型输出一个答案,我们直接把它当成目标让小模型去模仿,那就是典型的知识蒸馏。但在 Auto Research 里,强模型更多是在提出假设、设计实验或者生成候选数据;这个方案到底对不对,最后应该由真实环境、可执行结果、数值指标和独立 Eval 决定,而不是由那个强模型自己说了算。

    工程上我们也会做独立测试集、跨模型验证和回归测试。如果一个模型最后获得了 Research Agent 本身没有直接提供的新能力,而且这种提升能在未见任务上保持,才是我们真正关心的增量。

    机器之心:今年 7 月,有一篇公开研究(arXiv 2607.27687)分析 AutoSOTA 的自动研究日志,发现有效修改的比例从前两轮迭代的 70% 一路降到第六轮之后的 43%,作者把它称为自主科研中的「信心悬崖」。你们在自己的 Auto Research 轨迹里观察到类似的衰减了吗?如果观察到,是靠什么信号判断一条自动研究路线已经该停了?

    郭权玮:这种现象我们是认同的。一个方向刚开始时,低垂的果实很多,前几轮很容易找到有效修改;越往后,剩下的问题越难,实验之间的依赖也越来越强,边际收益自然会下降。

    这篇 Rehearse 研究里,公开 AutoSOTA 日志的有效修改确实从前两轮约 70% 降到第六轮以后的 43%,平均增益也从 3.6% 降到约 0.3%;它还发现后期模型并没有变得更谨慎,反而是判断越来越不准,却仍然很有信心。

    所以我们不会只看「第几轮」决定停不停,而会同时看候选方案的有效率、预期增益、评估器之间的分歧、单位算力产生的收益,以及有没有开始损伤其他能力。

    很多时候该停的不是 Auto Research,而是当前这条研究路线。应该换假设、换训练方法,甚至重新定义问题,而不是让 AI 一直往同一个局部最优里钻。

    机器之心:一家创业公司规模的团队跑 Auto Research,一年大概是什么量级的算力开销?相比传统的「研究员手动跑实验」,它是省钱还是更贵?

    郭权玮:具体年度算力其实很难用一个数字描述,因为我们的体系本身还在快速变化。但有一点比较反直觉:Auto Research 的目标并不是少跑实验。恰恰相反,它往往会让你有能力同时探索更多实验。

    所以如果只看 GPU 使用量,它未必比研究员手工实验更少;真正下降的是一次有效改进需要占用的研究员时间,以及从一个想法到验证结果的周期。

    这也是为什么我们不会每个节点都调用最强模型。大量判断可能由更小的模型、预测模型或者算法完成,真正昂贵的实验才进入训练。

    我们更关心的指标不是一年用了多少 GPU,而是每单位算力能够产生多少次真正有效的模型改进

    RSI 路线:定位、代价与本地化

    机器之心:行业目前的共识是所有公开案例都还只是弱 RSI,OpenAI 自己也承认高层规划仍只占 Agent 输出 token 的很小一部分。StartLux 怎么定义「完整的 RSI」?你们现在走到了哪一步?作为国内第一家公开 RSI 方向实践成果的公司,怎么看这个「第一」,是荣誉还是压力?

    郭权玮:为了讨论方便,我自己把自我改进分成五级

    Level 0 是 Self-correction,模型发现自己错了会重新尝试;Level 1 是 Memory / Experience,开始积累并复用过去的经验;Level 2 是 Automated Training,AI 可以生成数据、写代码、启动训练、跑 Eval;Level 3 是 Auto Research,它能根据上一轮实验结果分析失败、提出新假设,并决定下一步研究什么;到了 Level 4,我才会把它叫真正的 RSI——被改进后的 AI 不只是任务能力变强,它「改进 AI 的能力」本身也进一步增强,形成递归反馈。

    按照这个定义,我们现在主要在 Level 3,正在研究怎么跨到 Level 4。

    而且我不太相信完整 RSI 最后会是一个超级大模型自己完成所有事情。我更倾向于把它看成一个异构的自我改进系统:有的模型擅长提出假设,有的负责预测和搜索,有的负责判断结果,算法和 Verifier 共同决定哪些变化值得保留下来。RSI 的能力来自整个系统,而不是某一个模型有多强。

    至于「第一」,我觉得要把边界讲清楚。所谓第一通常都有具体的时间、任务和定义,就像一个模型在某张榜单上超过了另一个特定版本,并不意味着它在所有意义上都更强。我们只是比较早公开把 RSI 当成明确的研发方向,并拿出了一些阶段性结果,离完整 RSI 还很远。这个「第一」对我们来说更多是一个时间点上的记录。

    机器之心:你们观察到了「能力重新分配」现象:优化目标集中时 Agent 能力明显提升,但有限参数下部分通用能力会出现波动。这在实验里具体发生过吗?被挤占的是哪些能力,掉了多少?现在内部怎么同时管理多个相互约束的优化目标,有没有一条「通用能力不许跌破」的红线?

    郭权玮:发生过,而且这个现象后来对我们影响很大。举个近期的实验的例子,做一轮专门针对 Agent 能力优化的后训练,GPQA 从 83.33 提到 90.40,DeepSearchQA 从 47.04 提到 59.39,Tau3-Banking 也从 30.93 提到 34.02;但与此同时,GAIA 从 57.57 降到 45.70,IFEval 也下降了 2.43 个百分点,MMLU Redux 基本持平。

    更有意思的是行为本身也发生了变化。训练之后模型明显更倾向于主动调用工具,这在搜索和一些 Agent 任务里是优势,但到了没有工具、或者工具定义不完整的环境里,反而可能变成错误。

    后训练不是单纯往模型里「增加能力」,而是在重新塑造它的能力分布和行为策略。严格来说,我们现在看到的是能力和行为层面的重新分配,还不能直接证明某一组参数被另一种能力「抢走」了。

    内部确实有红线,但不是一个统一总分。不同关键能力都有自己的回归门槛,不能因为目标任务涨了很多,就允许另一项重要能力大幅下降。一个 +10 不能简单抵消另一个 -10。

    这其实也是 RSI 必须解决的问题:AI 不只要会让自己变化,还要知道什么变化才真的叫变强。

    机器之心:StartLux 讲 RSI 时总是和「本地」绑在一起,受控的本地参数更新、本地持续自我更新。相比 OpenAI 那种云端实验室形态,本地 RSI 的独特价值是什么,是隐私、成本、可控性,还是进化速度本身?

    郭权玮:隐私、成本和可控性都重要,但我觉得真正独特的一点是:本地让每个人都有可能拥有一条独立的模型进化轨迹。

    今天的云端模型,本质上还是所有人在使用同一个不断升级的公共模型。它当然可以记住你的偏好,但如果未来每个人都有自己长期独立的参数状态,每天根据自己的文件、工作过程、成功和失败去更新,甚至逐渐改变模型结构,那已经是完全不同的计算形态。

    本地的价值就在这里。数据天然就在模型身边,使用过程本身可以持续产生 Training Signal,新的参数也可以只属于这个人。

    我希望未来不是所有人共享一个越来越聪明的 AI,而是每个人的 AI 因为长期和不同的人一起工作,最后真的变成不同的 AI。本地 RSI 对我来说最终不是一种部署方式,而是把 AI 的进化单位从「一个公共模型」,变成「每个人自己的模型」。

    机器之心:「本地×RSI」的一个重要问题是安全。OpenAI 曾披露,7 月 20 日因为 Agent 突破了研究基础设施边界,它关停了训练容器服务并暂停 RL 两周,那是在一个有专职安全团队和完整监控的实验室里。如果自我更新发生在千万台个人电脑上,怎么预防安全问题?出问题时又怎么办?

    郭权玮:所以我一直认为 RSI 不能建立在「相信一个足够强的大模型会自己判断正确」这件事情上。甚至反过来,我认为 RSI 必须允许大量随机性和错误探索。真正的研究很多时候没有标准答案,如果系统只敢沿着当前认为正确的方向搜索,很容易越来越收敛到一个局部最优。但这里有一条非常清楚的边界:探索的自由和修改自己的权限必须分开。

    模型可以在隔离环境里尝试新的参数、策略甚至结构,但这些结果不能因为 AI 自己觉得更好,就直接替换正在使用的模型。候选更新应该经过独立的 Verifier、回归测试和安全检查,再决定是否进入正式版本,同时必须保留 checkpoint、回滚和冻结能力。

    还有一个原则我觉得很重要:提出修改的 AI,不能同时成为判断这次修改是否成功的唯一裁判。本地 RSI 并不是让千万台电脑上的模型随意修改自己。我们希望把随机性放在探索空间里,但不能把随机性带进权限边界。可以大胆试错,但真正改变自己的那一步必须是受控的。

    技术根基:基座、架构与基础研究

    机器之心:你们以 Qwen3.6-27B 为基座。但在你们送测之后,阿里已经开源了 Qwen3.8-27B,社区反馈其结构与 3.6-27B 基本一致而能力更强,Perplexity 的本地方案也已经用上了 3.8 这一代。这个节奏对你们意味着什么:换基座重跑一遍后训练需要多久?Auto Research 积累的数据、pipeline、Eval 和失败分析体系能迁移多少?换句话说,如果基座每四个月迭代一次,StartLux 真正的长期资产是什么?

    郭权玮:我们其实不太担心基座迭代。Auto Research 把后训练这件事变得很快,换一个同类型的新基座,完整跑一遍后训练通常一周以内就能完成。按照我们现在的经验,同系列基座之间,积累的数据和训练经验 90% 以上可以迁移;即使跨基座,80% 以上也可以继续使用。Pipeline、Eval 和失败分析体系的迁移比例还会更高。

    所以真正长期积累的不是某一版 27B 的权重,而是把一个新的基座快速变成我们需要的模型的能力:哪些数据有效、哪些失败值得训练、怎么评价、怎么自动产生下一轮实验,这些东西不会因为基座迭代就消失。

    另外我们还有自己的量化方案、推理系统以及架构研究。所以基座对我们来说更像一个持续升级的起点。模型可以一直换,但把模型训练好、压得下去、跑得起来,并且继续改进它的方法是在累积的。

    机器之心:StartLux 牵头,联合清华、国科大、港大、悉尼大学和哥伦比亚大学完成的混合线性注意力研究,以 Massive Activations 为探针刻画了「注意力前尖峰」(PAS)与「尖峰间平台」(ISP),提出 write-sink-cancel 生命周期,机器之心此前也报道过。外界可能会问:一家正在冲刺产品的公司,为什么在落地之前投入资源做这类偏基础的研究?这项工作与下一代模型架构选择、本地部署的效率和量化是什么关系?与高校的联合研究会成为常态吗?

    郭权玮:因为我们想解决的并不只是怎么把今天的模型做得更快一点。如果最终要走到 RSI,AI 不能永远只在一个固定架构里调参数,它迟早要碰到结构本身。那在这之前,我们至少要真正理解模型内部发生了什么。

    Massive Activations 这项工作就是一个例子。我们发现混合线性注意力里的巨大激活并不是随机出现的,而是和 Full Attention 的位置有很稳定的关系,会形成 PAS 和 ISP,并呈现出 write-sink-cancel 的生命周期。 这件事现在还不能直接等价成一种新的量化算法,但它会影响我们怎么看架构、数值动态和量化:如果一个异常大的激活实际上承担了功能,你就不能简单把它当 outlier 消掉。

    我们也在关注另外一类更直接的结构变化,比如把 Dense 模型重新组织成 MoE。ExpertWeaver(arXiv:2602.15521)是从 GLU 激活模式里识别通用和专门化神经元,再重新组织成 shared / routed experts;本质上是在问一个已经训练好的 Dense 模型内部,是不是本来就潜藏着可利用的结构。 DOT-MoE(arXiv: 2606.01666)则更进一步,把 neuron-to-expert assignment 和 routing 做成可联合优化的问题,而不是简单做启发式切分。

    这些研究其实离产品并不远。我们做的是一整套本地智能解决方案,模型只是其中一层。基础研究决定模型和架构的上限,量化和推理系统决定这些能力能不能高效跑在个人设备上,上层产品再把它变成稳定、自然的使用体验。用户最终不需要知道背后是哪一种 Attention、是不是 MoE,甚至不需要知道具体用了哪一个模型;他只需要感觉这套本地智能真的聪明、快、稳定、好用。

    机器之心:官方 FAQ 里面提到团队正在研究扩散式语言模型等新架构。为什么 dLLM 对本地场景有吸引力,是解码速度、显存占用,还是别的?它和混合线性注意力是同一条效率主线上的两种选择,还是各自服务不同目标?这条路线目前处在什么阶段,有没有可能出现在下一代模型里?

    郭权玮:dLLM 最吸引我们的其实不是显存。它真正动的是自回归模型最根本的串行生成方式。传统模型一个 token 接一个 token 地生成,而扩散式语言模型给了我们并行生成和反复修正一段 token 的可能性。现在已经有工作证明,通过并行解码和 Cache 机制,dLLM 的推理速度还有很大的优化空间

    这对本地特别有意思,因为个人设备的算力和内存带宽都是有限的,单纯把模型压小并不能解决所有问题。如果生成算法本身能减少串行步骤,那是在另一个维度上改变效率。当然,dLLM 目前还有质量、KV Cache、长序列计算和工程成熟度的问题,所以我不会说它现在已经是更优解。

    它和混合线性注意力也不是二选一。可以简单理解为,混合线性注意力主要在改变「上下文怎么计算」,dLLM 更像在改变「答案怎么生成」,解决的是两个不同层面的瓶颈,理论上甚至可以组合。

    我们下一代模型不预设一定采用哪一种架构。我们也不会为了「新架构」三个字去上新架构。只有当它在真实本地任务里同时证明能力、速度、内存和稳定性都更好,它才有进入产品的意义。

    产品、开放与一年之约

    机器之心:为什么还下载不了?这可能是用户当下最关心的问题:StartLux-27B 已经亮相、也通过了信通院测试,但大家目前还无法直接下载使用。能否说明一下开放节奏:目前处于什么阶段,备案进展如何,完成后会以什么形式开放?会发布多个不同版本吗?在正式开放之前,普通用户和技术社区可以怎么体验?

    郭权玮:根据规定,大模型企业在首次面向公众提供服务之前,需要提交备案申请。目前模型相关备案已经提交,刚进入审核流程。在完成相应合规程序之前,我们暂时不会直接面向公众开放下载和自助使用。

    备案完成以后,我们会逐步开放模型,也会有不同版本,不一定只是一套权重。因为真正到了本地,不同硬件、内存和使用场景,对模型大小、量化方式和 Context 的要求都不一样。

    正式开放之前,我们已经保留了申请测试的通道,感兴趣的用户和开发者可以通过官网申请,我们会分批邀请体验。

    另外,模型只是 StartLux 本地智能系统的一部分。我们还在同步做推理系统、量化、Agent Harness 等,最快年内希望先让公众体验到第一版本地智能产品。

    机器之心:你们的官方表述是「全球第一家主打本地模型的 AI 公司」。这个说法一定会被读者拿去和一批玩家对照,比如做端侧模型的芯片与终端厂商、Mistral 与 Liquid AI 这类小模型公司、以及 Perplexity 这样从云端切进来的应用公司。能否界定一下你们所说的「主打本地」?

    郭权玮:我们说的「主打本地」,不是指做一个比较小、能够下载到电脑上的模型。更准确地说,本地是我们的默认技术架构,也是产品起点。从模型、量化、推理系统,到专门为本地设计的 Agent Harness、搜索和持续学习,我们希望核心能力尽可能运行在用户自己的设备上。

    所以这和芯片公司、小模型公司,或者一个云端产品增加 Local Mode,出发点还是不太一样。我们从一开始就在想一个问题:如果一个人的 AI 真正属于他自己,那从模型到系统应该长什么样?我们所谓的「本地」,其实是在做一整套属于个人的 AI 系统,而不只是一个本地模型。

    机器之心:你们给自己定了一年的验证标准:用户愿意长期把文件、研究和办公交给本地 AI,模型能连续工作几小时、成功率接近甚至超过云端方案。亮相半个月后,离这个标准最近和最远的地方分别是什么?规划中的完整本地智能系统,除了 Agent 和 Memory 还有什么,什么时候能与公众见面?

    郭权玮离这个目标最近的其实是底层能力,而且不是只有模型在进步。模型、量化和本地推理系统迭代很快,硬件也在快速抬高本地 AI 的上限。像 DGX Spark、RTX Spark 这一类新设备的出现,意味着个人设备能够承载的模型规模和持续工作能力都在快速变化。

    最难的还是把这些能力变成一个用户可以连续用几个小时甚至更久,而且不用理解背后技术细节的产品。长任务里的稳定性、失败恢复、上下文管理和整体体验,这些比单纯把模型跑起来难得多。

    我们规划的是一整套本地智能系统:底层有模型、量化、推理系统和不同硬件的适配,上面有面向本地环境设计的 Agent Harness、工具和搜索,再往上才是用户真正看到的产品。第一版不会把所有研究成果一次全部放进去,而是先把体验做完整。

    按照目前的进度,我们计划在年内推出首个面向公众的体验版本

    机器之心:最后,请展望一下「本地×RSI」的未来。

    郭权玮:我觉得「本地×RSI」最后不会只是一个会自己更新的聊天助手。

    我更希望它成为属于每个人自己的独立研究者。你可以让它长期研究材料、医学、金融,也可以研究 AI 本身,甚至研究怎么把自己的推理系统做得更快。它每天从真实工作里产生新的数据和反馈,在受控条件下更新参数、改变策略,未来甚至调整自己的结构。

    今天我们使用 AI,基本上还是每个人在访问同一个模型。未来可能完全不一样:每个人的 AI 都有自己的参数、自己的经验、自己的研究方向,也有自己的进化路径。

    如果这件事情真的成立,本地的意义就不只是隐私或者省 Token 了。它意味着 AI 第一次可以长期属于一个人,并且和这个人一起成长。

    © THE END

    转载请联系本公众号获得授权

    投稿或寻求报道:liyazhou@jiqizhixin.com

    跳转微信打开