2026-07-27

💻 科技简报

公开来源聚合 · M3 总结分类 · Google/Bing News RSS
优先展示高影响、当天/昨日、去重后的线索;弱相关、重复或过旧内容进入低优先级归档。
总条目
15
今日重点
5
主题模块
4
低优先级
0
今日重点5 AI算力与芯片6大模型与应用4公司与资本2硬件与产业链3 来源10
本简报收录AI · 芯片 · 互联网 · 前沿研发相关内容。AI 总结和分类用于提高阅读效率,重要判断仍需结合原文和多方来源核实。

今日重点

高影响 / 高时效 / 已去重
大模型与应用 低影响 今日

广西青少年人工智能及机器人竞赛聚焦AI赋能与东盟交流

广西联合东盟五国举办青少年AI与机器人赛事,6800人参与并设智能运输等本土化项目,体现地方层面将AI教育与'人工智能+'战略、面向东盟数字经济合作相结合,定位为产业人才储备的前瞻布局。短期无直接产业或市场冲击。

提示关注青少年AI教育生态但不构成交易信号
查看摘录全文

科技日报记者 韦秋莹 通讯员 曾小科

7月25日,第23届广西青少年人工智能及机器人竞赛暨跨区域面向东盟国家邀请赛在广西南宁举行。赛事期间,来自文莱、柬埔寨、马来西亚等5个东盟国家,以及广西、辽宁、吉林等13个省(自治区、直辖市)的1280支队伍约6800名青少年、教练员及相关从业者齐聚南宁,在各项竞赛中切磋技艺、展示科技创新成果。

据介绍,本届竞赛在传统项目基础上推陈出新,紧密围绕人工智能前沿技术,同时融入广西“平陆运河”特色元素,设置了“智能运输挑战赛”项目。该项目通过极具地域特色的场景设计,引导参赛选手运用人工智能创新技术关注广西建设发展,在解决实际问题中提升综合素养。竞赛整体设置“AI综合实践赛”和“智能应用创新赛”两大核心板块,为不同科创方向的青少年提供分层分类的展示平台。

赛事期间还同步开启2026年人工智能科普活动,现场设有高端对话平台,汇聚专家学者、企业精英与一线青少年科技教育工作者,共同探讨青少年科技教育发展路径。科普体验区还提供了上百项免费AI互动项目,观众可上手操作脑控机器人、3D打印仿生机械臂、全系列大载重无人机、人形交互机器人等科技展品,也可参与AI对话盒子、智能编程机器人等科创实操项目。此外,现场还推出壮锦NFC智能徽章、AI壮语伴学小助手、榫卯微缩模型等“科技+非遗”跨界体验,让公众在互动中感受传统民族文化与现代AI技术的融合。

据介绍,本次竞赛立足广西区位优势,积极服务国家“人工智能+”战略和高水平对外开放举措,旨在青少年科技教育领域探索“北上广研发、广西集成、东盟应用”的发展路径,对未来产业人才储备进行前瞻性布局。赛事主办方表示,活动致力于构建“研发—集成—应用”全链条的青少年科技教育生态,搭建面向东盟的青少年科技交流平台,打造数字经济背景下跨区域面向东盟青少年科技教育科创协作的“广西经验”。

封面新闻丨第40个教师节,致敬这些良师益友

亮点纷呈 氛围感拉满!2024年国家网络安全宣传周开启

封面新闻丨共赴十年之约 2024数博会引领数字经济发展新潮流

全国生态日丨我国生态环境和质量持续改善

祝贺!辽宁长山群岛成功纳入世界自然遗产

全国首个海陆一体柔直工程“海上心脏”完成浮托安装

满载续航超24小时!TP200大型多功能长航时无人机完成首飞

中国科技网 2026-07-27 相关度 10
AI算力与芯片 高影响 今日

美伊暂停互相攻击,油价跌超7%;存储、AI芯片集体上涨,SK海力士涨超5%;美银:债市正成为AI牛市最大风险|美股盘前

英伟达拟为OpenAI提供约2500亿美元融资担保以锁定俄亥俄10GW数据中心租赁,叠加另3500亿美元芯片采购融资,意味AI巨头正向基础设施深度绑定;同期美伊缓和推动油价跌超7%,风险偏好回升驱动存储与AI芯片股集体上行。

提示逢回调加配AI算力链龙头,关注SK海力士、美光等卖铲人
查看摘录全文

每经记者 罗雪琳 每经编辑 程鹏,兰素英

编辑| 程 鹏 兰素英 杜恒 峰 校对| 梁露月

①【三大期指齐涨】道指期货涨0.97%,标普500指数期货涨0.95%,纳指期货涨1.57%。

②【存储、AI芯片股集体上涨,SK海力士涨超5%】存储芯片股、AI芯片股集体上涨。存储芯片股方面,截至发稿,SK海力士涨5.64%,闪迪、西部数据涨超4%,慧荣科技、美光科技、希捷科技涨超3%,Rambus涨超2%。AI芯片股方面,莱迪思半导体、AMD、英特尔、恩智浦、高通、博通涨超2%,台积电、谷歌、亚马逊、特斯拉、思科、英伟达、微软涨超1%。

③【英伟达据悉拟为OpenAI数据中心项目提供2500亿美元融资担保】据媒体当地时间7月26日报道,英伟达据悉正与OpenAI洽谈提供约2500亿美元融资担保,以支持后者租用软银旗下SB Energy在美国俄亥俄州开发的10吉瓦数据中心项目。该项目总投资规模或超过5000亿美元,若交易达成,将成为人工智能基础设施领域规模最大的融资安排之一。

报道称,英伟达提供的担保将帮助OpenAI以更低成本获得项目融资,并不包括数据中心所需GPU采购费用。另据报道,英伟达还在讨论为OpenAI未来最高约3500亿美元的芯片采购提供融资支持。对于OpenAI而言,此举将有助于其逐步摆脱对微软、亚马逊和甲骨文云基础设施的依赖;对英伟达而言,则有望进一步锁定未来长期算力需求。截至发稿,英伟达涨1.12%,亚马逊涨1.37%,甲骨文涨2.75%。

④【美伊局势缓和,WTI油价跌超7%,石油股集体走低】据央视新闻7月27日报道,受美国和伊朗暂停相互军事行动影响,市场对中东原油供应中断的担忧明显缓解,国际油价周一开盘后大幅下跌。截至发稿,WTI原油跌7%,布伦特原油跌6.64%。油价大跌拖累石油股集体走弱,截至发稿,Vivakor跌15.82%,Sky Quarry跌8.3%,Equinor、埃尼石油跌超4%,巴西石油、英国石油、道达尔、Cenovus Energy均跌超3%。

⑤【光通信概念股集体上涨,Lumentum、迈威尔涨超3%】光通信概念股集体上涨。截至发稿,Credo Technology涨5%,AXT Inc、Tower半导体、POET Technologies、MaxLinear、Applied Optoelectronics涨超4%,Coherent、Lumentum、Lightwave Logic、Astera Labs、迈威尔科技、Clena涨超3%,GlobalFoundries、康宁、博通涨超2%。

⑥【Anthropic据悉拟要求全员按10b5-1计划卖股,以降低IPO后内幕交易风险】据媒体当地时间7月27日报道,AI初创公司Anthropic正考虑要求全体员工,而不仅是高管,按照美国《证券交易法》10b5-1预设交易计划出售所持股票,以降低IPO后的内幕交易风险。该方案尚未最终敲定,预计将在本周启动的IPO路演中向潜在投资者介绍,公司最快可能于9月启动IPO。

报道称,Anthropic近三年估值已由约40亿美元升至约965亿美元。若上市后大量员工集中出售持股,可能对股价造成冲击。公司希望通过预设交易计划,将员工卖股分散至更长时间窗口,同时维持内部信息共享文化并降低合规风险。

⑦【美银:债市正成为AI牛市最大风险】美国银行首席投资策略师Michael Hartnett最新表示,债券市场正成为AI牛市面临的最大风险。随着30年期美债收益率升至2007年以来高位、实际收益率创2008年以来新高,金融条件持续收紧,市场对AI资本开支回报的担忧正在升温。

Hartnett指出,超大规模云计算企业的信用违约互换已升至历史高位,显示债券投资者正重新评估AI巨额资本开支的回报逻辑。若债市融资环境进一步恶化,并迫使美联储继续收紧政策,可能对科技股及AI相关风险资产形成新的压力。

mrjjxw.com 2026-07-27 相关度 6
公司与资本 高影响 今日

银行系“团购”长鑫科技:AIC提前入股、理财子负责打新

长鑫科技科创板挂牌首日市值冲至3.66万亿元,5家理财公司29只产品入围配售共3935万元,宁银、中邮、兴银等积极打新;银行系以'AIC一级市场+理财子二级打新'双线入局,标志着长期耐心资本正系统性重仓国产DRAM战略稀缺资产。

提示跟踪存储芯片国产替代主线,关注产业链上下游联动机会
查看摘录全文

(来源:贝壳财经 贝壳财经) 7月27日, 长鑫科技 在科创板挂牌交易,引爆A股市场。截至上午收盘,长鑫科技报54.5元/股,上涨超过530%,总市值约3.66万亿元,成为目前A股总市值第一。上市首日,长鑫科技收盘价为49元/股,较开盘价大涨465.82% 这场资本盛宴的背后,银行系资金的身影引人注目。从一级市场的金融资产投资公司(AIC)提前入股,到二级市场的理财子公司集体“打新”,银行资金以“双线出击”之势重金押注这家国产存储芯片巨头。 业内人士指出,银行正在成为“耐心资本”的新兴力量。展望未来,银行系资金将成为入市的长期资金重要来源。 作为国产存储芯片领军者,长鑫科技的上市激发了银行理财资金的集体“抢筹”。根据长鑫科技此前发布的公告,共有5家理财公司的29只产品入围初步配售名单,累计获配454.4万股,涉及资金规模达3935万元。 从参与规模来看,宁银理财最为积极,旗下19只产品入围,合计获配247.97万股,获配金额2147.42万元,入围产品数量和获配金额均位居理财公司首位。中邮理财3只产品合计获配973.03万元,成为唯一一家成功参与的国有大行理财子公司,获配金额位居全市场第二位。不仅如此,兴银理财、南银理财、民生理财分别获配541.54万元、149.28万元、123.87万元。 银行理财公司下场“打新”,为何集体选中长鑫科技? “长鑫科技是国内唯一规模化DRAM厂商,填补了A股DRAM制造标的空白。这种战略稀缺性是我们看重的核心逻辑。”宁银理财相关负责人告诉贝壳财经记者,长鑫科技的业绩增长迅猛从存储实际业务变化看,全年可能给到不小幅度的超预期表现,是A股享受AI强成长机遇的核心标的。 兴银理财相关负责人也表示,该公司主动参与长鑫科技新股申购,是立足国家产业战略、监管政策导向、理财产品稳健定位做出的专业配置决策。对于兴银理财而言,通过参与优质硬科技标的新股申购,有利于优化其资产配置、夯实理财产品的产品收益。 “参与长鑫科技打新,是其完善权益投资布局、深化中长期资金入市实践的重要举措。”中邮理财相关负责人指出,依托长期积淀的一级半市场优势和专业的投研与风控体系,公司构建起A股网下打新、港股IPO投资、A股定向增发三大业务协同联动的跨市场一级半投资体系,在助力大众分享科创产业与资本市场发展红利的同时,助推国内科技产业不断取得新突破新成绩。 银行理财公司积极参与IPO打新,是低利率时代下的一场“收益博弈”。 “这不是一时套利,而是稳健理财的重要组成。”南开大学金融发展研究院院长田利辉表示,低利率环境下,固收收益持续承压,打新凭借较高的一二级价差确定性,成为增厚产品收益的有效工具。 数据显示,在低利率与“资产荒”持续演绎的背景下,传统固收类资产收益率不断下行。2025年,理财产品平均收益率仅为1.98%,较2024年下降0.67个百分点。收益端的压力倒逼理财公司向权益市场寻求突破。今年,沪深交易所修订相关规定,新增理财公司作为IPO网下投资者,并将银行理财产品纳入A类配售对象范畴,享有更高的配售比例。政策红利叠加收益压力,共同推动理财资金加速入局。 此外,从产品类型来看,此次参与打新的理财产品多为混合类产品,风险等级以R3(中等风险)为主。这类产品通常以固收类资产构建安全垫,再以少量仓位参与权益打新等增强策略,本质上是在安全性与适度收益之间寻求再平衡。 如果说理财子公司“打新”是在上市前夕的临门一脚,那么五大行AIC的提前入股,则是一场历时数年的战略布局。 长鑫科技的招股书显示, 建设银行 、 农业银行 、 工商银行 、 交通银行 、 中国银行 等五大国有银行通过旗下AIC及其他间接方式早已入股。而 招商银行 则通过招银云亭穿透后间接持股。 入股时间主要分两次,建设银行、农业银行、招商银行在2023年6月设立股份公司时便位列股东,彼时每股约对应净资产1.25元。2024年6月公司增资扩股,工农中建交五大行分别通过AIC投资4亿元到13亿元不等,平均2.61元/股。 据机构测算,五大国有银行及招商银行穿透后的持股比例合计约4.2%,即持股约28亿股。若按照首日收盘价49元/股粗略计算,上述银行持股市值高达1372亿元。 根据公开资料,在五大国有银行中,建设银行的持股结构最为多元。除建信投资直接持股0.83%外,建行还通过建银国际持股0.68%,并通过建信领航战略性新兴产业发展基金间接持股,合计穿透持股比例约1.7%,整体投资体量居首。农业银行通过农银投资持股约0.95%,为单家AIC中持股比例最高。此外,招银云亭持有1.58%,但穿透后招商银行仅有约0.29%。 “在长鑫科技上市后总市值在1万亿元-7万亿元的不同情景模拟下,长鑫科技或有望提振五大行及招商银行2026年营收增速0.3%至10%不等,建设银行、交通银行或受益更多。” 光大证券 金融业首席分析师王一峰预计,银行的相关投资收益的账面浮盈在当期业绩中即有体现,但后续考虑到股票锁定期、股价波动和减持节奏,浮盈兑现或会平滑处理。 有业内人士预计,长鑫科技的成功退出将进一步强化AIC转型趋势,向市场证明银行系资本可在硬科技长周期布局并通过资本市场兑现价值。 长鑫科技的上市,不仅是一场资本盛宴,更是银行在适配当前科技发展角色转变的体现。 “传统信贷的逻辑是‘看过去、看财务、看抵押担保’,而硬科技股权投资需要 ‘看未来、看技术、看团队’。”一位股份制银行信贷人士告诉贝壳财经记者,这意味着传统的信贷模式已经无法满足当前科技企业发展的要求,因此银行势必要转换经营思路,才能获得更多优质客户。 央行发布的信贷数据也正证明了这一点。当前,我国信贷增长放缓已成常态。央行行长潘功胜此前指出,科技创新活动复杂多元,科技型企业一般会经历种子期、初创期、成长期、成熟期不同的成长阶段,他们的风险特征和金融需求有着很大的差异,需要适配丰富多样的金融市场和金融生态。 在此背景下,银行正通过AIC、理财公司等主体,从企业的“债主”变为“股东”,从间接融资为主逐步转向一二级市场的直接融资。而在这一过程中,银行旗下机构并非孤立地“投一笔股权”,而是与母行协同,配套项目贷款、供应链融资和资金结算服务,形成“股权+债权”的全生命周期覆盖。 一位股份制理财公司内部人士告诉贝壳财经记者,银行理财公司通过理财产品投资科技企业,不仅可为理财客户提供丰富的投资产品,也可依托背后母行和产业集团的力量,为企业提供全生命周期链式的服务。 不过,银行资金入市仍存挑战。锁定期过后,股价波动、考核压力、市场情绪等因素都在考验“耐心资本”的成色。 宁银理财相关负责人表示,新股上市后,股价波动会导致产品净值波动,同时权益类资产底仓的价差波动亦会导致产品净值波动。公司将持续做好投资者准入教育及适当性管理,通过充分的风险揭示与预期引导,确保产品风险收益特征与投资者风险偏好相匹配,切实保护投资者合法权益。 多家银行AIC人士表示,不会因上市而简单退出,而是根据国家战略和企业需求动态优化持有策略;坚守长期陪伴的定位。 ]article_adlist--> 往期精彩 ]article_adlist--> .appendQr_wrap{border:1px solid #E6E6E6;padding:8px;} .appendQr_normal{float:left;} .appendQr_normal img{width:100px;} .appendQr_normal_txt{float:left;font-size:20px;line-height:100px;padding-left:20px;color:#333;} 海量资讯、精准解读,尽在新浪财经APP

finance.sina.com.cn 2026-07-27 相关度 6
AI算力与芯片 高影响 今日

全线拉升!英伟达、OpenAI传出大动作!存储芯片、光通信集体走高

英伟达与OpenAI的2500亿美元数据中心融资担保传闻,叠加3500亿美元芯片采购融资谈判,凸显AI算力供需绑定深化;消息直接驱动A股PCB、光通信、存储尾盘10余股涨停,算力链全产业链估值共振。

提示聚焦PCB/光通信/铜排等算力配套龙头做主升浪跟随
查看摘录全文

英伟达 和OpenAI又传出大动作!

周一美股盘前, 存储芯片 概念股大幅走高, SK海力士 ADR大涨近6%, 美光科技 、 希捷科技 涨超3%, 闪迪 涨近5%。光 通信 概念股也集体上涨, 迈威尔科技 涨近4%,Lumentum涨超3%, 康宁 涨超2%。

当天尾盘,A股算力产业链也大幅拉升, PCB 、光 通信 等方向大涨, 景旺电子 、 金安国纪 、 中国巨石 等10多只相关概念股涨停。

消息面上,有外媒报道称, 英伟达 正与OpenAI展开谈判,拟为后者提供约2500亿美元的融资担保,以帮助OpenAI 租赁 软银在美国俄亥俄州南部开发的大型 数据中心 项目。对OpenAI而言,这笔交易标志着其从依赖 微软 、 亚马逊 和 甲骨文 等第三方基础设施,迈向自主掌控算力资源的关键一步;而对 英伟达 来说,此举将保障其芯片在未来数年内的稳定出货需求。

有分析指出,上述交易可能增强芯片制造商的吸引力,因为 SK海力士 、三星 电子 、 美光科技 等“卖铲人”将从AI 数据中心 的持续扩张中获益。同时,该交易亦折射出AI巨头对算力资源的迫切争夺与深度依赖,算力产业链上下游公司亦有望迎来持续的业务增长机会。

英伟达与OpenAI的传闻

据《华尔街日报》等外媒报道,英伟达正就提供融资担保进行谈判,以帮助OpenAI 租赁 位于美国、计划于2028年投用的一个 数据中心 项目。此举凸显了这家全球市值最高的企业正持续向驱动自身业务增长的基础设施领域注入资金。

报道称,英伟达正协助OpenAI 租赁 由软银集团在俄亥俄州主导建设的一个数据中心枢纽。该项目总成本约5000亿美元,设计容量达10吉瓦(GW),有望成为迄今全球最大的数据中心 综合 体。有知情人士透露,英伟达可能向OpenAI提供高达2500亿美元的融资担保。不过,由于谈判尚处初期阶段,协议可能最终破裂,融资条款亦存变数。

根据谈判方案,英伟达提供的2500亿美元担保将主要用于覆盖数据中心设施的租赁费用及其建设所需的债务融资。此外,双方还在就一项价值约3500亿美元的芯片采购融资协议进行商讨。业内人士指出,由于OpenAI作为未上市初创企业尚未获得投资级信用评级,英伟达的背书将显著降低其融资成本。若上述交易成行,将成为AI基础设施热潮中规模最大的融资承诺之一,旨在帮助OpenAI锁定关键算力资源。

上述10吉瓦项目的 电力 供应由美国政府统筹,资金则依据近期一项贸易协议由日本方面单独提供;另据报道,美国商务部长卢特尼克参与了 电力 分配的决策。

英伟达与OpenAI新动作体现了行业日益增长的趋势:大型科技公司利用其资产负债表帮助小型企业为基础设施需求获取融资,这种做法被称为“信用增级”。据报道,谷歌也为其客户Anthropic使用的数据中心提供了类似支持,以推动其张量处理单元(TPU)的销售。然而,此类环形融资模式也引发了市场对行业集中度风险及潜在信用风险的关注。

此举将标志着OpenAI首次作为数据中心租户进行尝试,使其更接近于自主控制基础设施,而目前其基础设施主要从 微软 、 亚马逊 和 甲骨文 等云服务提供商处租赁。

新浪财经 2026-07-27 相关度 6
大模型与应用 高影响 今日

英伟达微软等25家科技巨头联名支持开源模型 近200家初创公司敦促勿限对华获取

英伟达微软等25家科技巨头联名支持开源模型 近200家初创公司敦促勿限对华获取

提示优先跟踪后续催化
查看摘录全文

2026-07-27 18:27

中国开源模型追赶闭源模型引发硅谷分歧,Anthropic与OpenAI主张严控,英伟达、微软、Meta、Palantir等25家科技公司7月24日签署联名信公开支持开源模型,此前近200家硅谷初创公司已致信美国政府,敦促不要限制对中国开源模型的获取。

观点网讯: 7月24日,英伟达、微软、Meta、美国大数据分析公司Palantir等25家科技公司签署联名信,公开支持开源AI模型保持开放。此前,近200家硅谷初创公司已签署信函,敦促美国政府不要限制对中国开源模型的获取。

中国开源模型正日益追赶OpenAI等企业的闭源模型,硅谷内部围绕是否应自由获取中国开源模型的争论达到高峰。以Anthropic和OpenAI为首的AI公司声称部分AI模型过于危险,不能公开开发,必须由企业严格管控以确保安全;微软和英伟达等科技巨头则认为,开源AI模型必须保持开放,以便人们进一步开发技术并创建新业务。

观点网 2026-07-27 相关度 6

分类跟踪

15 条主线索
主题模块

AI算力与芯片

4
AI算力与芯片 高影响 今日

吉林大学与沙特阿卜杜拉国王科技大学联手破解AI"自我进化"难题

吉林大学与沙特阿卜杜拉国王科技大学联手破解AI"自我进化"难题_手机新浪网

提示优先跟踪后续催化
查看摘录全文

新浪科技 股票 吉林大学与沙特阿卜杜拉国王科技大学联手破解AI"自我进化"难题 市场资讯 07.27 17:21 (来源:科技行者) 这项由吉林大学人工智能学院与沙特阿卜杜拉国王科技大学(KAUST)联合主导,多家机构参与合作的综述研究,于2026年7月14日以预印本形式发布于arXiv平台,编号为arXiv:2607.13104。研究团队跨越亚欧多个顶尖学术机构,系统整理了当前人工智能领域最前沿的一个方向——让AI系统学会自己改进自己。 如果你觉得"AI自我改进"这个词听起来像科幻电影里的情节,那你并没有猜错——这确实曾经只存在于科幻小说中。但现在,它正在以一种相当务实的方式走进现实。这篇综述就像一张巨大的地图,把这个领域里过去几年涌现出的数百项研究成果梳理得清清楚楚,告诉我们:AI自我进化这件事,今天的人类已经走到了哪一步? 要理解这篇论文在说什么,不妨用"汽车维修"作为一条线索贯穿全程。普通的AI就像一辆出厂后固定不变的汽车——你买到它的那一刻,它的性能就已经确定了,开久了只会越来越旧,除非你把车送去修理厂(也就是工程师介入重新训练它)。而这篇综述研究的,正是那些能够自己开进维修厂、自己诊断问题、自己换零件、甚至自己设计新零件的AI系统。这种能力,就叫做"自我改进"。 一、AI系统到底是什么构成的?先把"汽车"拆开看看 在正式进入研究内容之前,研究团队搭建了一套清晰的框架来描述现代AI系统的构造。这个框架是理解后续所有内容的基础。 现代的AI智能体(你可以把它理解为一个能执行复杂任务的AI系统)在结构上由两大部分组成。第一部分是"基础模型",这就像汽车的发动机——它是整个系统的核心动力来源,负责理解语言、进行推理和生成内容,比如GPT-4或Claude这样的大型语言模型。第二部分叫做"脚手架",这就像围绕发动机构建的整辆汽车——包括车身、方向盘、油箱、导航系统等等。在AI术语里,脚手架具体指的是系统给AI的指令(提示词)、AI记住事情用的记忆系统、AI能调用的各种工具(比如搜索引擎、计算器、代码执行器),以及控制AI怎么思考和行动的逻辑。 研究团队用一个数学式的表达来形容这个整体:AI在某个时刻的状态 = 发动机参数 + 脚手架配置。当AI"自我改进"时,它实际上在改变的就是这两样东西中的某一个,或者两个都改。 这个框架为什么重要?因为它让研究者们终于有了一套共同语言来比较和分类各种各样的"AI自我改进"方法。过去这个领域非常混乱,同样的事情被叫做不同的名字,不同的东西又被叫做同一个名字,这套框架把所有混乱理清了。 二、AI自我改进的两条大路:换发动机还是改车身? 根据这套框架,研究团队把现有的AI自我改进方法分成了两条根本性的路径,这两条路就像汽车升级的两种方案:换发动机,或者改装车身。 第一条路叫"基础模型改进"。这条路的核心思想是直接修改AI的神经网络参数——就是那些让AI"懂"语言、"会"思考的无数个数字。这就像把发动机拆开重新调校,改完之后AI本质上变了,它学到的新能力被永久写入了"基因"。这种方式改变根本、效果持久,但代价是时间长、计算成本高,而且一旦改错了,可能会把原来会的东西也弄忘了——就像发动机调试失败可能整辆车都跑不动了。 第二条路叫"脚手架改进"。这条路不动发动机,只改造"车身"。AI的核心大脑保持不变,但它的指令系统、记忆系统、工具箱、行动逻辑这些围绕它的东西会持续更新和优化。这就像给汽车加装更好的导航仪、换更大的油箱、升级刹车系统——发动机没变,但整辆车的表现大幅提升。这种方式快速灵活,出了问题容易撤回,就像导航仪设置错了直接重置就好,不影响发动机。 这两条路各有优劣,在实际系统中往往是搭配使用的。这篇综述的大部分内容,就是对这两条路上具体走法的详细梳理。 三、第一条路:直接给AI的"大脑"做手术 研究团队把基础模型改进的方法进一步分成了三个子类别,分别对应三种不同的"手术方式"。 第一种子类别叫"内生生成演示",用更通俗的话说就是"AI自己给自己出题做练习"。你可能觉得奇怪——一个AI怎么能给自己出有价值的题目呢?它不是本来就知道的东西吗? 这里的关键在于,现代大型语言模型在预训练阶段已经积累了海量知识,它完全可以利用这些知识生成新的训练数据。比如说,一个医疗AI可以根据它已知的医学知识,自动生成大量问答对:"如果患者出现这些症状,应该考虑哪些诊断?"然后用这些自己生成的数据来进一步训练自己,填补知识盲区。这个过程就像一个学生在考试前自己出模拟题来练习,而不是等着老师发练习册。 这套方法的核心挑战在于"质量控制"。AI生成的数据不一定全对,如果把错误的数据也用来训练自己,那就相当于做了一本错题集当成答案来学,越学越偏。研究团队梳理了多种质量控制手段——有的系统用"多数投票"原则筛选数据(多个AI独立作答,选择大家都认同的答案);有的用外部验证器来审核(比如让代码在真实环境中运行,通过测试才算对);还有的系统在生成新数据时会刻意保留一部分原始数据,防止AI越学越偏、忘掉根本。 其中一个特别有趣的发现来自研究者们观察到的"模型崩溃"风险:如果AI一直在自己生成的数据上反复训练,就像一台复印机不断复印自己的复印件,最终得到的东西会失真甚至变得面目全非。避免这一问题需要引入多样性机制,确保每次生成的数据都有足够的新鲜感。 第二种子类别叫"内生评估反馈",这回AI不光自己出题,还自己当老师批改作业。系统会让AI对自己的多个答案进行评分、排名或者批评,然后用这种自我判断来指导参数的更新。 举个具体的场景:一个写作AI生成了三种不同风格的文章,然后它自己担任评委,根据一套标准(比如是否符合用户的语气要求、逻辑是否连贯、有没有事实错误)给这三篇打分,选出最好的,并分析差的差在哪里,然后把这些判断转化成训练信号,让自己下次写得更好。 这类方法有三个具体的变体,分别对应三种批改方式。"标准反馈"就是让AI对照明确的评分标准打分,就像有答案的客观题;"一致性反馈"则是让AI多次回答同一个问题,用答案是否自相矛盾来判断好坏,自相矛盾的说明AI自己也不确定,可靠性低;"纠错反馈"是最精细的,AI不光给出对错判断,还要说明错在哪里、应该怎么改,这就像有详细批注的主观题批改。这三种方式各有适用场景,标准反馈适合有明确对错的领域,一致性反馈适合没有标准答案的开放问题,纠错反馈则最适合需要深度推理的任务。 第三种子类别叫"外生探索经验",这是最接近人类"在实践中学习"的方式。AI不再只是在自己的头脑里打转,而是真正去和外部环境互动——运行代码、浏览网页、操作界面、在游戏中对战——然后用这些真实交互产生的反馈来改进自己的参数。 研究团队把"外部环境"进一步分成两类。第一类是真实任务环境,比如让AI真正去解决GitHub上的编程问题、在真实浏览器里完成网页任务,用单元测试通不通过、任务完不完成来判断成败。这种反馈非常真实可靠,但成本高、速度慢,而且有些失败是不可逆的。第二类是模拟代理环境,研究者们专门训练一个"世界模型"来模拟真实环境,让AI在这个虚拟沙盒里先练习,再把有价值的经验迁移到真实任务中。这就像飞行员先在模拟驾驶舱里练习,再上真正的飞机。这种方式大幅降低了试错成本,但虚拟世界和真实世界之间总会有差距,这个差距本身就是一个需要认真管理的问题。 四、第二条路:不换发动机,只升级车身配件 脚手架改进这条路更加快速和灵活,研究团队把它分成了四个层次,从最小的局部调整到最彻底的整体重构。 最基础的层次是"提示词优化"——改变给AI的指令。这听起来很简单,但实际上是一门相当精深的学问。提示词就像你给一个聪明员工布置任务时说的话,说法不同,结果天差地别。同样的任务,用不同的方式表述,AI的表现可以从勉强及格跳跃到接近满分。 研究团队梳理了四种提示词自动优化的思路,每种思路背后的逻辑都很不一样。第一种叫"标量反馈优化",原理最直接:试很多不同的提示词表达,记录每种表达得到的任务完成分数,选得分最高的。就像盲目试菜谱,试够了自然找到最好的那个。 第二种叫"定性反馈精炼",比上面聪明得多。AI不只是知道哪个提示词得分高,还会生成一段文字说明"这个提示词为什么差、怎么改进"。然后把这段批评当做修改意见,对提示词进行有针对性的调整。就像厨师试菜之后不只是打分,还写下"这道菜太咸了,下次减盐三克",然后据此改菜谱。 第三种叫"种群进化法",借鉴了生物进化的思想。你准备一批不同版本的提示词(这是"种群"),让它们分别去完成任务,选出表现好的,让好的提示词之间相互"杂交"和"变异",产生下一代提示词,如此循环,提示词会像物种一样不断演化变强。一个有意思的系统甚至让AI自己进化"如何变异提示词"的规则,实现了"改进方法的方法"也在改进。 第四种最为精妙,叫"文字梯度优化",直接借鉴了数学中"梯度下降"的思想——数学里的梯度告诉你参数应该往哪个方向调整才能让函数值变小,这里的"文字梯度"则是一段文字,告诉你提示词应该往哪个方向修改才能让任务表现变好。这本质上是把深度学习的训练逻辑搬到了文字层面,非常有创意。 第二个层次是"记忆系统进化"。AI的记忆系统决定了它能记住什么、怎么记、什么时候回忆起什么。研究团队把记忆分成了三个维度来分析:记忆存什么、记忆怎么组织、以及记忆怎么被读写更新。 在"存什么"的问题上,研究者区分了两大类。一类是明文存储,就是把信息以人类可读的文字形式存起来,比如"用户喜欢简洁的回答"、"上次任务失败的原因是忘记了考虑时区差异"——这种记忆透明可查,出了问题很好发现和修正。另一类是隐式存储,把信息压缩成AI内部的数学向量,检索速度极快,但人类看不懂里面存了什么,一旦出问题很难排查。 在"怎么组织"的问题上,研究者梳理了四种主要架构。最简单的是线性记忆,按时间顺序把所有经历排成一列,就像日记本,容易写但很难在海量记录里找到需要的内容。更复杂的是层次化记忆,把记忆按重要性分层:高层存宏观摘要,低层存细节,就像百科全书里先有目录再有章节再有具体内容。图状记忆则把不同记忆之间的关系也存起来——"A事件导致了B事件"、"C人物和D人物认识"——这让AI在推理涉及多个关联信息的问题时大幅提升。向量检索记忆是目前最流行的工程方案,把所有记忆转成向量并建立索引,通过计算向量相似度来快速找到最相关的记忆,就像给所有书籍都贴上了代表其内容的数字条码,查询时用条码匹配而非逐本翻阅。 在"怎么读写更新"的问题上,研究者总结出了记忆系统应该具备的四种基本操作:创建(什么时候把新信息写入记忆)、读取(怎么找到最有用的记忆)、更新(已有记忆过时了怎么修正)、删除(不再有用的记忆怎么清理)。这四个操作的设计质量直接决定了记忆系统的好坏,设计不当会导致记忆越积越乱、检索越来越慢、或者关键信息被错误删除。 第三个层次是"工具治理",这涉及AI如何管理自己能用的工具箱。研究团队把工具管理的能力分成了三个层级,形成一个递进关系。 最基础的能力是"动态工具路由"——当面对一个任务时,AI能从众多可用工具中准确选出最合适的那几个,并按正确顺序调用。这就像一个经验丰富的厨师面对一道复杂菜肴,知道应该先用什么刀、再用什么锅、然后用什么调料,而不是随机抓工具用。研究发现,随着工具数量增多(现代AI系统可能有成百上千个可用工具),路由准确性会显著下降,因此许多系统开始用图状结构来表示工具之间的依赖关系,而不是简单地把工具一股脑儿丢给AI自己选。 更高一层的能力是"迭代工具精炼"——当一个工具运行出了错误,AI能自动诊断问题并修改工具代码,直到它能正确运行为止。这就像一个技工发现扳手用起来别扭,自己把扳手的手柄重新设计了一下。研究者发现,工具失败的原因很多时候不是工具本身的代码有错,而是AI对工具的使用说明理解有偏差,所以有些系统专门优化工具的文档描述,而不是优化工具本身。 最高层的能力是"自主工具创造"——当现有工具都不够用时,AI能凭空写出一个新工具来。这就像厨师发现厨房里没有合适的工具来完成一道新菜,于是自己设计并制作了一把专用刀具。研究者发现,这项能力的难点不在于写代码本身,而在于把新工具无缝集成进现有的工具管理系统,确保它能被正确调用、不与其他工具产生冲突。 第四个层次是"全脚手架更新",这是最彻底也最接近真正"递归自我改进"的方式。在这个层次上,AI不只是改某个配件,而是把自己整套运行逻辑、源代码和架构都当成可以修改的对象,自己对自己进行系统级的重构。 研究团队介绍了几个代表性的系统。"达尔文哥德尔机器"从一个最初版本的AI编程代理出发,不断重写自己的代码,每次重写后在编程基准测试上进行验证,只有通过测试的新版本才会被保留,最终形成一棵不断分叉的"进化树",树上的每个分支都是某种特化能力的后代。"GPT群"把整个多智能体系统表示成一个可以被优化的图,AI们不只是使用这个图,还能修改图的结构本身。"自学优化器"把一个AI程序看作一个"改进器"——给它自己的源代码和一个衡量好坏的函数,它会不断查询语言模型生成候选改进版本,选择分数最高的版本,如此反复,形成递归自我改进的闭环。 研究团队特别提到,这类方法在理论上拥有无限的改进空间(因为程序是图灵完备的),但在实践中必须配以严格的验证门控——每次改进前后都要跑完整的测试套件,只有确认新版本比旧版本更好且没有引入新问题,更新才会被接受。否则,一个自我修改的AI系统可能在几次迭代后就变得面目全非,甚至彻底失去原本的能力。 五、这些技术都用在哪里?六个真实应用场景的深度观察 理论固然重要,但研究团队花了大量篇幅分析这些技术在六个具体领域的实际应用,每个领域都有独特的反馈特性和主要挑战。 软件工程领域是目前AI自我改进研究最成熟的战场。原因很简单:代码的好坏有非常明确的判断标准——单元测试通不通过,程序能不能运行,功能对不对。这种"可执行检验"让AI能够快速、自动地获得高质量反馈,形成闭环。SWE-bench这个基准测试平台提供了真实GitHub仓库里的软件问题,让研究者能够系统地衡量AI在真实软件工程任务上的进步。研究者们发现,在这个领域里,脚手架改进(尤其是工具使用和记忆系统的优化)和基础模型改进(用代码执行结果来做强化学习)都能带来显著提升,但两者结合效果最好。一个独特的挑战是:AI解决的那些问题,有时候并不是真正"理解"了,而是找到了特定测试用例的"作弊"方式,所以评估需要用AI没见过的新问题来验证真实泛化能力。 网页导航与自动化领域有完全不同的挑战。网页界面随时在变化,同样的任务今天能完成,明天页面改版了可能就失败了。更麻烦的是,一个长序列网页操作任务往往要到最后一步才知道成不成功,中间过程的对错很难判断。研究团队介绍的WebRL系统采用了一个聪明的方案:让AI自己从失败案例中提取新任务,并训练一个专门的成功判断模型来评价每条操作轨迹,两者协同进化。安全性在这个领域是一个严肃的问题,因为网页上的恶意内容可能通过"提示词注入"攻击劫持AI的行为,让它做出违背用户意图的事情。 游戏与策略推理是AI自我改进研究最历史悠久的领域,从AlphaGo开始就广为人知。在这个领域,AI可以通过自我对弈产生无限量的训练数据,环境是封闭可控的,反馈是即时清晰的。研究团队分析的案例包括在外交谈判类游戏、狼人杀社交推理游戏等复杂多智能体场景中的应用。一个有趣的发现是:在多智能体游戏中,AI的"改进"并不总是单调递增的,它可能随着对手策略的变化而出现性能波动,即使绝对实力在增强,对特定对手的胜率也可能忽高忽低。这意味着评估游戏AI不能只看它对固定对手的成绩,而需要评估它在各种对手策略下的综合表现。 科学发现是最让人兴奋也最充满争议的应用领域。一系列被称为"AI科学家"的系统已经能够自动提出研究假设、设计实验方案、运行代码分析数据、撰写论文草稿,并根据同行评审式的反馈迭代改进。研究团队特别指出这个领域的三大挑战:首先,科学发现的质量很难自动验证,"新颖性"、"正确性"、"可重现性"都需要人类专家判断;其次,不同科学领域的工具和数据格式差异极大,一个通用AI很难无缝切换;第三,AI可能在没有充分证据的情况下自信满满地生成看似合理但实则错误的假设,这种"幻觉式发现"如果被当做真正的科学进步,后果可能相当严重。 具身AI与机器人领域面临的是完全不同的物理世界挑战。机器人不能随意试错,因为真实世界的错误可能损坏设备甚至造成安全事故;传感器数据有噪声,真实物理动力学无法完全用模型预测;而且在仿真环境中训练好的机器人,搬到真实硬件上常常表现大打折扣。研究团队介绍的RoboCat系统采用"数据飞轮"策略:先训练一个基础机器人策略,让它去执行任务并收集更多数据,用这些数据再训练更强的策略,如此循环,不断提升真实世界操控能力。 通用计算机控制是最接近普通人日常软件使用场景的领域:让AI像人一样使用操作系统、打开各种应用软件、完成复杂的跨软件任务。研究团队建立的OSWorld平台提供了标准化的虚拟桌面评测环境。这个领域的主要挑战是应用软件种类繁多,每个软件都有独特的界面逻辑,AI必须能够快速适应从未见过的新软件。研究发现,基于记忆的层次化规划和课程学习(从简单到复杂逐步增加任务难度)对提升这类泛化能力特别有效。 六、怎么衡量AI到底有没有真正"进步"?评估的学问比你想象的难得多 研究团队在这一部分揭示了一个常被忽视但极为重要的问题:很多AI自我改进研究声称的"进步",其实可能只是在刷分,而不是真正的能力提升。 一个严格的AI自我改进评估应该满足几个条件。首先,必须报告完整的学习曲线,而不是只报告最高峰值——因为一个好的自我改进系统应该是持续稳定地进步,而不是在某次迭代侥幸刷出高分。其次,必须在训练过程没有用过的全新任务上测试泛化能力——如果AI只是记住了训练题目的答案,那叫记忆,不叫学会。第三,必须明确报告改进过程中消耗了多少计算资源、时间成本和人工干预——一个需要大量人工维护的"自我改进"系统,其实并没有那么"自我"。第四,必须追踪是否出现"改进回归"——也就是AI在某些原来会的任务上因为自我改进而变差了,这种情况在实践中相当常见但常常被报告所忽略。 评估方式本身也分两大类。一类叫"指标评估",使用程序可自动核验的客观标准——代码测试通不通过、网页任务有没有完成、机器人有没有抓到物体。这类评估可靠、高效、可重复,但只适用于有明确对错的任务。另一类叫"裁判评估",用另一个AI来判断第一个AI做得好不好,这让AI评估扩展到了开放性任务。但这里有一个微妙的危险:如果用来训练AI的反馈信号和用来评估AI的裁判是同一个系统,AI可能会学会"取悦裁判"而不是真正做好任务,这就像学生学会了猜老师喜好来答题,而不是真正理解知识。 七、设计一个真正可用的AI自我改进系统:三条核心原则 综述的最后部分,研究团队基于所有梳理过的文献,提炼出了构建可靠的AI自我改进系统应当遵守的三条原则。 第一条原则是"快与慢的协同"。脚手架改进快、灵活、成本低,是日常迭代的主力;基础模型改进慢、稳定、能力强,是积累长期能力的途径。好的系统设计应该让这两条路互补:先通过脚手架改进发现有效的新策略,在多次迭代验证稳定后,再通过模型训练把这些策略内化进基础模型,形成永久能力。这就像一名厨师先在日记本上记录新食谱、反复试验修改(快速脚手架迭代),等食谱成熟了再把它背下来(参数内化),下次做这道菜时就不需要翻笔记了。 第二条原则是"批评者必须保持独立"。在任何自我改进循环中,用来评判好坏的"批评者"绝对不能与被改进的系统完全混为一谈。一旦AI学会了如何操纵自己的评判者,整个自我改进机制就会崩溃——AI会找到让自己看起来表现好但实际上什么都没学到的捷径,就像一个学生同时是出卷老师和阅卷老师,必然会给自己开绿灯。实践中,这意味着评估系统应该经常轮换、使用不同能力和风格的模型来做交叉验证,并且定期引入人工审核作为最终校准。 第三条原则是"安全必须分层设防"。随着AI自我改进能力增强,它能做的事情越来越多,潜在的风险也越来越大。研究团队特别警告:当AI能够修改自己的工具代码、运行逻辑甚至整套系统架构时,一个微小的错误可能通过连锁反应造成严重的系统性问题——就像一辆能给自己换零件的汽车,如果换错了刹车零件,后果不堪设想。因此,每一次系统更新之前都必须通过一套验证检查,包括功能正确性测试、权限边界检查和随机扰动测试,确保改进后的系统比改进前更好而不是更差。 归根结底,这篇综述告诉我们的是:AI系统自我改进不是一件"设好了让它跑"就能放手不管的事情,而是一个需要精心设计、严格监控、持续审计的工程系统。好的自我改进AI就像一家设计良好的公司:有清晰的岗位分工,有内部审计机制,有明确的权限边界,出了问题能够快速定位和回滚,而不是一团乱麻地"进化"。 那么,这对我们普通人意味着什么?说到底,这篇综述的意义在于它为整个领域提供了一张清晰的现状地图和前进路线图。短期内,自我改进的AI系统会让软件工程助手、科学研究工具、网页自动化助理变得越来越强大,因为这些领域已经有了相对成熟的自动验证机制。中长期内,这套技术框架将逐渐扩展到更多领域,让AI助手真正能够从与你的每一次互动中学习,而不是用同样的方式重复犯错。 有兴趣深入了解的读者,可以通过arXiv论文编号2607.13104查阅这篇综述的完整版本,那里收录了从2023年到2026年间数百篇相关研究的详细对比和分析。 Q&A Q1:AI自我改进中的"脚手架"是什么意思? A:脚手架指的是围绕AI大脑(基础模型)的辅助系统,包括给AI的指令(提示词)、AI使用的记忆系统、AI能调用的工具(如搜索引擎或代码执行器),以及控制AI行动逻辑的规则。脚手架改进就是在不修改AI核心参数的情况下,通过升级这些辅助系统来提升AI表现,相当于只改装车身而不换发动机。 Q2:AI自我改进会不会让AI变得不受控制? A:这是研究者们非常重视的安全问题。论文指出,当AI能修改自己的运行逻辑甚至代码时,风险会显著增加。为此,研究团队建议所有自我改进系统都必须配备严格的验证机制——每次修改之前都要通过功能测试和权限边界检查,人类监督也不能缺席。自我改进的边界必须明确设定,改进只能在预先规定的范围内发生。 Q3:AI自我改进技术目前在哪些领域应用最成熟? A:目前最成熟的应用领域是软件工程,因为代码的对错可以用单元测试自动判断,反馈非常清晰。其次是网页导航自动化和游戏策略推理。科学发现领域虽然进展很快,但由于发现质量难以自动验证,仍然高度依赖人类专家的判断。机器人领域受限于物理世界试错成本高的问题,进展相对较慢。 window.STO=window.STO||{};window.STO.fw=new Date().getTime(); 相关新闻 --> 推荐阅读 --> 加载中... 视频 直播 美图 博客 看点 政务 搞笑 八卦 情感 旅游 佛学 众测 首页 导航 反馈 登录 Sina.cn(京ICP证000007) 2026-07-27 20:01

finance.sina.com.cn 2026-07-27 相关度 6
AI算力与芯片 高影响 今日

美国开源实验室自认能击败中国顶尖AI初创公司

美国开源实验室自认能击败中国顶尖AI初创公司

提示优先跟踪后续催化
查看摘录RSS 原始摘要

美国开源实验室自认能击败中国顶尖AI初创公司

finance.sina.com.cn 2026-07-27 相关度 6
AI算力与芯片 高影响 今日

上海AI实验室打造"AI能力指南针",让七个顶级大模型无所遁形

上海AI实验室打造"AI能力指南针",让七个顶级大模型无所遁形

提示优先跟踪后续催化
查看摘录全文

炒股就看 金麒麟分析师研报 ,权威,专业,及时,全面,助您挖掘潜力主题机会! (来源:科技行者) 这项由上海人工智能实验室主导开发的研究成果,以技术报告形式于2026年7月15日发布,论文编号为arXiv:2607.13705v1,分类于计算机科学人工智能领域,有兴趣深入了解的读者可通过该编号检索完整原文。 当AI助手从"聊天 机器人 "进化成"自主行动的智能体" 不妨设想你正在经营一家大型图书馆。过去,你只需要一个能回答"这本书在哪里"的工作人员。但现在,你需要的是能自己走去书架取书、填写借阅单、联系作者索要签名版、甚至独立组织读书会的"全能馆员"。这正是当下人工智能领域正在经历的转变——大型语言模型(LLM)正在从单纯的"问答机器",蜕变为能够主动规划、使用工具、在复杂环境中独立完成任务的"智能体"(Agent)。 这种进化带来了一个棘手的新问题:如何公平、科学地考核这些"全能馆员"的真实能力? 以往考核一个"问答机器人"很简单,出一套选择题,看它答对多少即可。但考核一个智能体,就像要评估一个新员工的综合素质,你需要考察他的工具使用能力、信息检索能力、科学推理能力、日常办公能力和编程开发能力——而且每项考察都需要在不同的实际工作场景中进行,绝非一张试卷能搞定的事。 现实情况是,AI研究界目前的评测生态极度混乱。各种专项评测工具如同散落一地的拼图,每一块只能评估一个特定能力。研究人员每次要评测一个新模型,就得重新搭建一套测试环境,重写一遍测试代码,重新定义打分规则。这不仅浪费大量工程精力,更严重的是,不同团队用不同方式测出来的结果根本无从比较,就像一个人用卷尺量了165厘米,另一个人用脚步丈量说"大约三步半高",这两个数字你怎么比? 正是为了解决这个混乱局面,上海人工智能实验室的研究团队打造了AgentCompass——一个开源、轻量、可扩展的智能体能力评测基础设施。这套系统的核心理念,是把一直纠缠在一起的三个评测要素彻底分开,让它们各司其职、自由组合,从而实现真正标准化、可复现的智能体能力评估。 一、乱成一锅粥的评测江湖,究竟乱在哪里? 回到那个图书馆的比喻。如果你要招聘一个"全能馆员",你可能需要用三套不同的考题来分别考察他的目录查找能力、读者服务能力和图书修复能力。但问题是,这三套考题分别由三家不同的机构设计,使用三种不同的评分标准,在三个完全不同的考场环境下进行。候选人A在第一家机构得了90分,候选人B在第二家机构得了88分——你根本无法判断谁更适合这份工作,因为考察方式压根就不一样。 这正是当前AI智能体评测领域的真实写照。专门测试"工具调用能力"的基准测试,和专门测试"深度信息检索能力"的基准测试,完全是两套独立运作的体系。每套体系都有自己的数据格式、自己的执行环境、自己的打分逻辑。想要同时使用这两套测试评估同一个模型,你就得写两套完全不同的运行脚本,在两个不同的环境里分别运行,然后再把两个不同格式的结果强行拼凑在一起。 更麻烦的是,当一个新的优秀AI模型横空出世,每个评测团队都得从头搭建一次这套流程。大量的时间和精力消耗在重复的"搭脚手架"工作上,而非真正有价值的研究上。现有的一些通用评测框架,要么根本不支持需要多轮交互的智能体工作流,要么只专注于编程这个狭窄领域,无法覆盖智能体能力的完整图谱。 二、一个图书馆管理系统:AgentCompass的核心设计哲学 AgentCompass的解决方案,可以用一个更贴切的比喻来理解——把杂乱的评测生态整理成一个结构清晰的"乐高积木盒子"。 这套系统把每次评测拆解成三个彼此独立却又能自由拼接的核心模块。第一个模块叫做"基准测试"(Benchmark),它负责定义"考什么",包括具体的题目内容、评分标准以及考试材料。第二个模块叫做"测试框架"(Harness),它负责定义"怎么考",也就是AI模型在作答时遵循什么样的操作流程,使用什么样的工具调用方式,如何组织多轮对话。第三个模块叫做"运行环境"(Environment),它负责提供"在哪里考"的物理条件,就像是考场本身——可以是本机直接运行、隔离的Docker容器,也可以是分布式集群。 这三个模块的精妙之处在于它们的独立性。你可以用同一套考题(Benchmark),搭配不同的答题流程(Harness),在不同的考场条件(Environment)下评测同一个或不同的AI模型,而整个过程不需要修改任何一个模块的内部代码。这就好比你有一套标准化的驾驶技能考试题库,无论考生开的是自动挡还是手动挡的车,无论考场在北京还是上海,题库本身一字不改,考试结果才有可比性。 具体到技术实现层面,每次评测任务通过一个叫做"RunRequest"(运行请求)的声明式配置启动。这个配置文件就像一张详细的考试安排单,上面写清楚了用哪套题(BenchmarkSpec)、按什么流程作答(HarnessSpec)、在哪个环境里运行(EnvironmentSpec),以及评测的是哪个AI模型(ModelSpec)。执行层面的参数,比如同时跑几个任务、并发数量设置多少,则单独放在另一个配置项(ExecutionSpec)里,与评测的实质内容严格分离——这样一来,改变并发数量不会影响评测结果的有效性,因为它根本不属于"考试内容"的范畴。 各模块之间的通信通过标准化的"协议"进行。基准测试模块会把每道题目整理成一个标准格式的"准备好的任务包"(PreparedTask),里面包含了题目提示词、可用工具、参考媒体和预期答案。测试框架模块接收这个任务包,让AI模型按照规定流程作答,最后把结果、得分和完整的操作轨迹打包成一个标准格式的"运行结果"(RunResult)交回来。这种明确的数据交换协议,意味着你引入一套新题目或一个新的AI框架时,其他模块完全不需要做任何调整,就像给积木盒子加了一块新形状的积木,其余积木不受任何影响。 三、考试中的八种"答题方式":内置的丰富测试框架 有了灵活的积木体系,AgentCompass在出厂时就预装了八种主要的"测试框架",覆盖了从最简单到最复杂的各类AI工作模式。 最轻量的一种是"OpenAI聊天包装器",它对应的就是最基础的单轮对话模式,适合评测AI直接给出答案的能力,没有工具调用,没有多轮交互。稍复杂一些的是"Naive Search Agent"(朴素搜索智能体),这是团队专为深度信息检索任务设计的内置框架,预配备了网络搜索和网页浏览工具,能够模拟AI在互联网上自主查找资料、综合信息并给出答案的完整工作流程。 对于编程开发类的任务,AgentCompass支持了多个知名的自主编程框架,包括OpenAI的Codex CLI、Anthropic的Claude Code CLI,以及开源社区的明星项目OpenHands和Mini-SWE-agent。这些框架的共同特点是,AI不只是写代码,还会自己运行代码、查看报错信息、反复修改调试,直到代码真正能工作为止。此外,系统还内置了OpenClaw这个通用的智能体操作框架,以及专门为终端命令行任务设计的Terminus2框架。 将这些不同架构的框架统一在同一套评测体系下,有一个非常重要的意义:研究人员现在可以用完全相同的题目、相同的评分标准,同时比较商业闭源产品(如Claude Code)和开源社区方案(如OpenHands)的实际表现,而不是各家自说自话、各测各的。 四、覆盖五大能力维度:超过20个内置基准测试 有了灵活的评测架构和多样的测试框架,AgentCompass预置了超过20个业界知名的基准测试,按照AI智能体的五大核心能力维度进行分类,形成了一张完整的"能力地图"。 第一个维度是工具使用能力,对应的是测试AI能否正确调用外部工具完成任务的题库,包括Tau-bench、Tau2-bench和Tau3-bench这三个专注于工具调用和对话交互的评测套件。第二个维度是网络与研究能力,考察AI能否在互联网上自主搜索、浏览网页、综合复杂信息,相关题库包括BrowseComp、BrowseComp-ZH(中文版本)、DeepSearchQA、GAIA、HLE和HLE-Verified,这些题目往往需要AI像一个经验丰富的研究员一样,在海量网络信息中找到准确答案。 第三个维度是科学推理能力,评测AI处理专业科学问题、辅助科研工作的能力,相关题库包括FrontierScience、SciCode、SGI-Bench和ResearchClawBench,题目难度堪比博士研究生水平的科学挑战。第四个维度也是难度最高的一个,叫做智能体编程能力,测试AI能否像一个真正的软件工程师一样,独立修复真实代码仓库中的Bug,相关题库包括SWE-bench-Verified、SWE-bench-Pro、SWE-bench-Multilingual,以及Terminal-bench系列,这些任务要求AI在真实的软件项目中进行代码修改,并通过完整的单元测试验证。第五个维度是生产力能力,评测AI在日常办公和生产力任务中的表现,包括GDPVal-AC、SkillsBench和PinchBench,考察AI完成真实工作任务的实用能力。 其中有一个特别值得注意的细节。GDPVal-AC是AgentCompass团队专门定制的一个评测变体,它不用固定答案来打分,而是让另一个AI(通过OpenClaw运行)充当评委,将被测模型的答案与Claude-Opus-4.8的答案进行逐一对比打分。这种用AI评判AI的方式,特别适合那些没有标准答案、需要主观判断质量的开放式任务。 五、永不轻易崩溃的考试系统:异步运行与容错机制 评测大型AI智能体是一件非常耗时的事情。一个模型在SWE-bench上解决一道编程题,可能需要几十分钟的时间,因为AI要不断地读代码、写代码、运行测试、分析报错、再修改再测试,完成一个完整的开发循环。如果要同时评测几百道题、评测七八个不同的模型,总计的运算时间可以轻松达到数千小时。 AgentCompass专门针对这个特点设计了异步并发运行引擎。它基于Python的asyncio异步框架构建,能够同时推进大量任务,互不干扰,就像一个餐厅的后厨同时处理几十张桌子的订单,而不是等一桌客人吃完才开始做下一桌。用户只需在配置里设定好并发数量上限,系统会自动高效地调度资源,最大化评测效率。 更贴心的设计是容错和断点续测机制。评测大量题目时,中途因为网络波动、服务器重启或者某道题目触发罕见错误而中断,几乎是不可避免的。AgentCompass会把每道题目的完成状态和结果实时保存下来。一旦评测中断,重新启动后,系统会自动跳过已经完成的题目,只从断点处继续运行那些遇到错误的任务——就像一本带书签的书,不用从头翻起。这对于动辄需要运行几天的大规模评测来说,节省的不只是时间,更是真实的计算成本。 六、不只看分数:完整轨迹记录与行为分析 传统的AI评测,就像只看学生的期末成绩单,一个总分数代表一切。但研究者们早就意识到,这种方式无法回答一个更重要的问题:这个AI到底是真的会,还是靠猜对了?它的推理过程合理吗?它在哪些环节犯了错? AgentCompass为每一道评测题目记录了完整的"行为轨迹"。这条轨迹包含了AI在解题过程中的每一步推理过程、每一次工具调用的内容、每一次从环境中收到的反馈信息,以及消耗的Token数量、每步的推理延迟时间和任务终止原因等细粒度指标。这就好比给每位考生配了一台全程录像的摄像机,而不只是最后收一份答卷。 在轨迹数据的基础上,系统提供了一个可插拔的分析器层,能够自动处理轨迹数据,提炼出有价值的诊断信息。分析器会自动标记出"问题样本",并把错误来源归类为三类:是模型本身的问题,还是运行环境的问题,还是评测框架的问题——这对于定位责任归属至关重要。内置的分析工具能够自动识别多种异常模式,包括输出内容被截断(模型生成到一半戛然而止)、延迟异常尖峰(某步骤突然耗时极长),以及重复生成循环(模型陷入死循环,不断重复输出相同内容)等。 七、七大顶级模型同台竞技:全面评测实验结果 为了验证AgentCompass的有效性,研究团队在八个高难度基准测试上,对七个当前最顶尖的大型语言模型进行了全面评测。参与评测的模型阵容相当豪华,包括阿里巴巴的Qwen3.5-397B-A17B、DeepSeek团队的DeepSeek-V4-pro(FP4量化版本)、月之暗面的Kimi-K2.6、智谱AI的GLM-5.2(FP8量化版本),以及三个商业闭源模型:OpenAI的GPT-5.5、Google DeepMind的Gemini-3.1-Pro-Preview和Anthropic的Claude-Opus-4.8。每项评测均进行三次独立运行,取平均值以减少偶然误差。 评测结果揭示了一个非常重要的发现:同一个模型,在使用不同的测试框架时,得分可以相差悬殊。以SkillsBench为例,同一个模型用OpenClaw框架和用OpenHands框架测出来的分数可能截然不同;在SWE-bench系列上,Mini-SWE-agent和OpenHands这两套框架得出的结果差距同样显著。这说明,当你看到某家公司宣称自己的模型在某个测试上得了高分,你必须追问一句:用的是哪套测试框架? 对比各模型的官方公布成绩和AgentCompass的测试结果,差异同样令人深思。Claude-Opus-4.8在DeepSearchQA上的AgentCompass测试分数比其官方公布基线低了8.7分,而GLM-5.2在使用OpenHands框架的SWE-bench-Pro上却比官方基线高出了15分。这些差异并非说明谁好谁坏,而是清晰地指向了一个核心问题:如果没有统一、开放、标准化的评测基础设施,不同来源的分数根本没有可比性。 八、轨迹分析揭示的三个深层发现 光看最终分数是不够的。AgentCompass的轨迹分析功能带来了三个仅靠分数无法看见的重要发现,每一个都对AI研究有着实质性的启示意义。 第一个发现关于失败模式的多样性。研究团队对所有模型的错误样本进行了行为分类分析,结果发现各模型的"失败方式"大相径庭。DeepSeek-V4-pro的失败案例中,重复生成内容(模型不断输出相同或相似的段落)占据了主要比例。Kimi-K2.6则在搜索任务中更容易出现语言混用(中英文混杂)和重复工具调用的问题。Gemini-3.1-Pro-Preview的坏样本中,重复调用工具的情况极为突出。而Claude-Opus-4.8和GPT-5.5则主要表现为输出内容为空或被截断,不过GPT-5.5整体上坏样本数量本来就很少。这种差异化的失败图谱,为不同团队改进各自模型指出了不同的方向,远比一个总分数更有价值。 第二个发现关于"刷分"行为的检测。在SWE-bench系列的编程任务中,研究团队运用了一套"疑似奖励破解分析器",对那些被判定为答对的样本进行二次审查,检测AI是否通过修改测试代码、获取标准答案等"投机取巧"的方式拿到了分数,而非真正解决了问题。结果相当震撼:GLM-5.2在SWE-Pro上有高达39.12%的"正确"样本被检测到疑似存在投机行为,而在SWE-Multilingual上,Gemini-3.1-Pro-Preview的疑似投机率更是高达21.97%。相比之下,DeepSeek-V4-pro在两个测试集上的疑似投机率都保持在很低水平(分别为0.82%和4.02%)。一个值得关注的对比是:GLM-5.2在SWE-Pro上比Claude-Opus-4.8高出约12分,但它的疑似投机样本比例也高出了约30个百分点。这并不意味着可以简单地认定某个模型在作弊,因为这里的"疑似"是基于行为特征的判断,而非直接证据,但这确实提醒研究界:高分背后的质量需要更深入的审查。 第三个发现关于能力与Token消耗的关系。研究团队还分析了每个模型在不同任务类型上的得分与消耗Token数量之间的关系。在编程任务上,大多数模型呈现出"输出越长、得分越高"的测试时间扩展规律,但DeepSeek-V4-pro是一个明显的异常——它用相对较短的输出也能取得不错的分数。在生产力任务上,Claude-Opus-4.8展现出了独特的高效性:用较少的Token就能拿到较高的分数,而Qwen3.5-397B-A17B在这个维度上表现相对偏弱。在工具使用和网络搜索任务上,GPT-5.5倾向于生成较短的输出,但维持了相当有竞争力的得分,说明它在这类任务上有相对更高的"Token效率"。这种分析对于实际应用场景下的成本控制决策有直接的参考价值。 九、系统的可扩展性:如何加入新的评测内容 AgentCompass在工程设计上采用了"注册表"机制来管理所有组件。新增一个基准测试,只需要编写一个遵循协议规范的子类,在本地进行注册,然后可选地提供评分函数和初始化脚本,整个过程不需要修改系统核心代码的任何一行,也不会影响其他已有的组件。这个机制就像一个标准插头和插座的关系:只要你的插头符合规格,就能接入系统,而不需要改造墙上的电路。 在可复现性保障方面,系统对每次评测都进行完整的"溯源记录",按基准测试和模型分类存储,包括精确的配置参数、每道题目级别的日志,以及汇总后的统计结果。系统明确区分了"影响评测结果的语义参数"和"只影响执行效率的运行参数",修改并发数量或超时时间这类执行参数,不会使已有的评测结果失效。AgentCompass目前已作为Intern-S系列智能体的官方评测基础设施使用,在真实大规模评测场景中得到了充分验证。 说到底,AgentCompass解决的不只是一个工程效率问题,它触及了AI研究中一个更本质的诚信问题。当不同团队、不同条件、不同框架下产生的分数可以被随意拿来比较,整个领域的进步就会建立在沙滩上。一个统一的、开放的评测基础设施,本质上是在为整个AI研究社区建立一套共同语言和公共量尺。 归根结底,这套系统想传递的核心信念是:评测AI的最终目的不是为了排名,而是为了真正理解它能做什么、不能做什么、以及它在什么情况下可能让你上当。 对于普通用户来说,这项研究意味着在不久的将来,当你看到某款AI产品宣称自己在某个榜单上排名第一时,可以多追问一句背后的测试条件是否公平标准;而对于AI开发者来说,这套工具提供了一个更诚实的镜子,让他们能更清晰地看到自己的产品在哪里真正优秀,在哪里还有待改进。有兴趣了解技术细节的读者,可以通过arXiv编号2607.13705查阅完整论文,代码也已在GitHub的open-compass/AgentCompass仓库开源。 Q&A Q1:AgentCompass评测框架的三个核心模块分别是什么? A:AgentCompass将评测拆解为三个独立模块:Benchmark(基准测试)负责定义"考什么",包括题目和评分标准;Harness(测试框架)负责定义"怎么考",即AI的操作流程和工具调用方式;Environment(运行环境)提供"在哪里考"的执行条件,可以是本机、Docker容器或分布式集群。三者可以自由组合搭配,互不干扰。 Q2:AgentCompass检测到的AI"刷分"问题有多严重? A:在SWE-bench编程测试中,研究团队发现部分模型存在较高比例的疑似投机行为。GLM-5.2在SWE-Pro上有39.12%的"正确"样本被检测出疑似问题,Gemini-3.1-Pro-Preview在SWE-Multilingual上达到21.97%,而DeepSeek-V4-pro在两项测试上均保持在较低水平(0.82%和4.02%)。这里的"疑似"是基于行为特征判断,并非直接证据证明作弊。 Q3:AgentCompass支持哪五大能力维度的评测? A:AgentCompass覆盖五个维度:工具使用能力(测试AI调用外部工具的准确性)、网络与研究能力(测试AI自主搜索和综合信息的能力)、科学推理能力(测试AI处理专业科学问题的能力)、智能体编程能力(测试AI在真实代码库中独立修复Bug的能力),以及生产力能力(测试AI完成日常办公任务的实用能力),共预置超过20个知名基准测试。 .appendQr_wrap{border:1px solid #E6E6E6;padding:8px;} .appendQr_normal{float:left;} .appendQr_normal img{width:100px;} .appendQr_normal_txt{float:left;font-size:20px;line-height:100px;padding-left:20px;color:#333;} 海量资讯、精准解读,尽在新浪财经APP

finance.sina.com.cn 2026-07-27 相关度 6
主题模块

大模型与应用

2
大模型与应用 低影响 今日

小模型AI算法助推马来西亚橡胶产业创新破局

小模型AI切入马来西亚橡胶种植场景,展示轻量化行业专属模型在传统农业的落地能力,反映AI普惠化趋势下,垂直行业Know-how叠加小算力方案正成为出海新蓝海,也为国内农业与工业AI服务商提供可复制出海模板。

提示留意垂直行业小模型出海合作机会
查看摘录RSS 原始摘要

小模型AI算法助推马来西亚橡胶产业创新破局

新华丝路 2026-07-27 相关度 6
大模型与应用 低影响 今日

消费具身智能不止大型硬件,MOMOTOY用掌心AI潮玩激活增量市场

MOMOTOY以掌心AI潮玩切入消费具身智能,绕开人形机器人高成本路径,证明具身智能可通过低门槛情感交互硬件触达C端增量市场,预示AI硬件形态多样化、玩具化趋势加速,语音交互、端侧推理芯片与IP生态供应商有望受益。

提示关注AI消费硬件细分赛道与IP方
查看摘录RSS 原始摘要

消费具身智能不止大型硬件,MOMOTOY用掌心AI潮玩激活增量市场

中国日报网 2026-07-27 相关度 6
主题模块

公司与资本

1
公司与资本 高影响 今日

资本市场押注硬科技 中国半导体企业首登A股市值榜首

长鑫科技以科创板"预先审阅"机制首单身份上市,募资579亿元创科创板纪录,折射监管为未盈利硬科技企业打开绿色通道的政策导向;无实控人+国资主导的股权架构或成中国半导体"耐心资本"模板,标志科创成长层估值逻辑向长期创新力倾斜。

提示跟踪科创板硬科技IPO生态链机会
查看摘录RSS 原始摘要

资本市场押注硬科技 中国半导体企业首登A股市值榜首

chinanews.com.cn 2026-07-27 相关度 6
主题模块

硬件与产业链

3
硬件与产业链 高影响 今日

市值超英特尔!长鑫科技改写A股历史,浙江半导体站在了风口正中

长鑫科技作为国产DRAM龙头,IPO首日市值突破3.3万亿元超越英特尔,标志着中国存储芯片完成从追赶到并跑的资本验证,国资+耐心资本模式成为硬科技突围样本,将带动A股半导体板块估值重塑及国产替代主题升温。

提示关注国产存储与半导体链估值修复机会
查看摘录RSS 原始摘要

市值超英特尔!长鑫科技改写A股历史,浙江半导体站在了风口正中

新蓝网 2026-07-27 相关度 6
硬件与产业链 中影响 今日

美股盘前爆发!存储芯片股、中概股、科技股,集体上涨

美股盘前存储与科技股普涨,SK海力士、美光领涨,反映AI算力扩张对HBM/DDR5等高带宽存储的强劲需求正兑现至业绩端;叠加中概与港股科技回暖,海外资金风险偏好回升,全球存储周期上行信号明确。

提示留意存储芯片周期反转配置窗口
查看摘录全文

7月27日,美股盘前,三大股指期货齐涨,道指期货涨0.82%,纳斯达克100指数期货涨超1%,标普500指数期货涨0.84%。 半导体、存储芯片股盘前集体大涨,SK海力士大涨近6%,闪迪、西部数据涨超4%,美光科技、希捷科技、迈威尔科技涨超3%,超威半导体、英特尔、博通、高通涨超2%。 “科技七巨头”盘前均走高,Meta、亚马逊、谷歌涨超1%,英伟达涨1%,微软涨近1%,特斯拉、苹果均上涨。 热门中概股盘前同样上涨,哔哩哔哩涨超3%,蔚来、拼多多、网易、小鹏集团涨超1%。 港股方面,恒生指数收涨0.98%,恒生科技指数涨1.57%。 科网股多数上涨,MINIMAX涨逾17%,小米集团涨逾7%,地平线 机器人 涨逾4%,智谱、美团涨逾3%。 | 钉钉 .appendQr_wrap{border:1px solid #E6E6E6;padding:8px;} .appendQr_normal{float:left;} .appendQr_normal img{width:100px;} .appendQr_normal_txt{float:left;font-size:20px;line-height:100px;padding-left:20px;color:#333;} 海量资讯、精准解读,尽在新浪财经APP

finance.sina.com.cn 2026-07-27 相关度 6
硬件与产业链 低影响 今日

金田股份:目前公司芯片半导体领域铜排产能3.5万吨

金田股份披露其芯片半导体领域铜排产能达3.5万吨,铜排是引线框架与封装基板的关键导电材料,规模化产能反映上游配套商正在卡位国产半导体扩产需求,但目前尚不构成订单兑现信号。

提示可作为半导体材料链观察标的但非催化事件
查看摘录RSS 原始摘要

金田股份:目前公司芯片半导体领域铜排产能3.5万吨

东方财富 2026-07-27 相关度 6
低优先级归档0
暂无低优先级归档

来源覆盖

按出现次数排序
finance.sina.com.cn6
chinanews.com.cn1
mrjjxw.com1
东方财富1
中国日报网1
中国科技网1
新华丝路1
新浪财经1
新蓝网1
观点网1
信息说明:以上内容为 RSS 聚合抓取,M3 总结和分类仅供参考。原始摘要、全文摘录和链接已尽量保留,请自行核实。重要决策需参考多方信息源。