2026-06-13

🛡️ 军事简报

公开来源聚合 · M3 总结分类 · Google/Bing News RSS
优先展示高影响、当天/昨日、去重后的线索;弱相关、重复或过旧内容进入低优先级归档。
总条目
15
今日重点
5
主题模块
3
低优先级
0
今日重点5 冲突态势9国防政策5装备与军工1 来源11
本简报收录军事动态 · 国防政策 · 冲突态势 · 装备发展相关内容。AI 总结和分类用于提高阅读效率,重要判断仍需结合原文和多方来源核实。

今日重点

高影响 / 高时效 / 已去重
装备与军工 高影响 今日

2026年国防军工行业深度报告:“小摩托”无人机研究报告,低成本远程打击新范式,战法多变战果颇丰

“小摩托”无人机代表低成本可消耗武器趋势,暴露传统察打无人机在高对抗环境下生存短板(MQ-9损失3.3亿美元),价值不对称的消耗战或成未来冲突新常态,倒逼各军事强国重新评估装备体…

提示优先跟踪后续催化
查看摘录全文

一、低成本远程打击需求催化,“小摩托”加速成为战场新变量 (一)“小摩托”无人机:定义与由来 根据 新华网 ,近年来,一些武器生产商先后着手研发一种三角翼无人机,如俄罗 斯 已是入实战的“非洲菊”巡飞弹、美国格里芬航空航竺公司推出的MQM-172“箭头”无人机、波兰空军理工学院设计的PLargonia无人机等。这些无人机除了统一采用三角翼布局外,还有一个共同特征,就是配置了小型二冲程活塞式发动机,与摩托车发动机类似,因此也被称为“空中小摩托”。 根据新华网、 人民网 ,各国研发的“小摩托”无人机的特点在于:一是主要打击对象为地面目标,二是低成本、可消耗,即通过“价值不对称”消耗敌方昂贵的武器系统和有限的防空导弹。 (二)传统无人机与导弹在高消耗作战中的成本劣势和产能短板日益显现 传统中大型无人机本质上是侦察与打击平台,其作战效能高度依赖作战环境。根据《The new killer drones: understanding the strategic implications of next generation unmanned combat aerial vehicles》(MICHAEL MAYER),由于传统察打一体无人机通常以长航时、远程遥控和持续盘旋监视为主要特征,其优势主要体现在低威胁空域条件下,往往需要己方掌握制空权或至少具备较稳定的局部空中优势,才能充分发挥侦察识别、目标跟踪和即时打击能力。根据《The Effectiveness of Remotely Piloted Aircraft in a Permissive Hunter Killer Scenario》(Lance Menthe et al.),从既有作战实践看,MQ-1、MQ-9这类传统中大型察打一体无人机,主要是在反恐、反叛乱等低威胁空域中发挥作用,且需要成套的通信指挥体系支撑;一旦进入防空严密、空域受争夺的环境,其生存性和持续作战效能都会受到明显制约。据新华网,截至3月9日,美军对伊朗打击行动的前10竺已损失11架MQ-9型“死神”无人机,总价值超过3.3亿美元。 导弹仍是最成熟、最有效的远程精确打击手段之一,但成本高昂。根据新华网、人民网,巡航导弹被公认为精确打击弹药。例如“战斧”巡航导弹,射程2500千米,飞行航迹灵活,精确制导和低空突防能力强,擅长突袭地面固定目标。然而,这类武器的性能优势往往建立在高水平推进、制导控制、材料、隐身和系统集成等能力之上,属于成本较高、技术门槛较高的打击手段。根据新华网,2024年时在役巡航导弹采购单价普遍在100万-400万美元间不等,部分型号甚至更贵。根据美国国防部2026财年预算申请总览报告,2024-2026年,美国“战斧”巡航导弹年度采购数量分别为30、22、57枚,总价分别为8.84、7.08、9.46亿美元,具有产量小、单价高的特点。 “小摩托”无人机迅速兴起,以低耗投入撬动高效作战。相较于MQ-9““死神”等传统察打一体无人机,“小摩托”不追求高载荷、多任务和高信息化作战能力,而是以低成本换取较强航程和规模化投送能力,显著降低了对机场、地面控制站、卫星通信链路和维护保障体系的依赖。相较于“战斧”巡航导弹,其虽然战斗部较小、精度和突防性能较弱,但在射程接近的情况下,成本仅为后者的百分之一,使其能够以更低门槛实施成体系、连续性和饱和式打击。 二、从技术探索到批量应用,产品谱系与技术特征持续完善 (一)技术渊源:德以南非奠基,伊朗发扬光大 类似“空中小摩托”构型的无人机出现时间较早。根据中国军网、Defence Express、阿拉伯防务新闻,20世纪80年代,德美两国相关公司研制的DAR无人机,以及南非一家公司推出的ARD-10无人机设计方案,都采用三角翼构型、活塞发动机,且使用车辆作为发射平台。根据英国空军月刊2022年12月发布的文章,南非肯特隆公司将ARD-10无人机的设计方案出售给以色列飞机工业公司(IAI)。以色列在此基础上研制出“哈比”(Harpy)无人机。根据IAI官网发布的产品手册、Defense Update,“哈比”无人机集成了无人机和导弹的双重优势,能够对敌方雷达目标进行搜索识别与打击摧毁,具有覆盖范围广、航程远、滞空时间长和打击效率高等特点,曾出口至土耳其、韩国、中国和印度等多个国家。 根据Flight Global,中国于1994年向以色列购买“哈比”无人机,并于2003年与IAI签订该款无人机系统升级合同,迫于美国压力最终该升级合同未能实施。据CASI发布的报告,2017年,解放军发布一款ASN-301“(飞龙300A)反辐射巡飞弹。ASN-301由西安爱生技术集团研制,并于2017年8月举行的建军90周年阅兵中亮相,其作战编组可形成由54架无人机组成的火力单元。该型装已率先列装于解放军空军电子对抗部队。然而,根据新华网,由于““哈比”无人机的主业是反雷达,其所用技术较为先进,对制造工艺的要求也高,导致它们的价格昂贵,难以大量使用。 伊朗以民用化路线实现了“小摩托”无人机的低成本突破。根据英国空军月刊2022年12月发布的文章,2004-2005年,南非肯特隆公司也将ARD-10无人机的设计方案出售给伊朗,后开发出“见证者-131”(Shahed 131)、“见证者-136”(Shahed 136)无人机。根据中国军网,伊朗“见证者-136”(Shahed 136)自杀式无人机,大量采用低成本民用零部件。该机2021年首次公开亮相,因为其造价低、航程远、威力大,后来被俄罗斯引进并加以本土化改造用于作战。 (二)主要产品 1. 伊朗“见证者-136” 根据中国军网2022年报道,伊朗“见证者-136”自杀式无人机,1架仅2万美元左右,且能搭载50千克战斗部进行较长距离飞行。 “见证者-136”无人机通过发射架发射,由火箭助推起飞。根据弹箭与制导学报公众号,一个卡车发射架可以发射5架“见证者-136”无人机,整个装置可以安装在任何军用或商用卡车的底盘。“见证者-136”无人机以稍微抬起的角度发射,并通过火箭发射辅助装置进行初始飞行。 “见证者-136”无人机采用伊朗制造的MadoMD-550活塞发动机来驱动尾部螺旋桨,并通过卫星导航与惯性导航组合制导。机头部分包含估计重30-50kg的高爆破片战斗部以及用于精确攻击的光学器件。这种重量级的战斗部可以弥补其制导精度上的不足,其有效载荷还包括可以拍摄静态和实时图像或视频的摄影设备。根据中国军网2025年报道,“某种程度上说,当前各国研发的‘空中小摩托’或多或少受到伊朗‘见证者-136’无人机的启发。” 2.俄罗斯“天竺葵-2” 根据国防科技大学公众号,俄罗斯基于伊朗“见证者-136”无人机,开发了新型三角翼无人机“天竺葵-2”,在俄罗斯在对乌克兰特别军事行动发挥重要作用。一方面,“天竺葵采取低空路线,这使得它们难以被防空导弹系统击中;同时,“天竺葵-2”自杀无人机活塞发动机的低热特征使得便携式防空导弹(肩扛导弹)的红外自导引头也很难捕获它们。另一方面,“天竺葵承袭“见证者”无人机低成本特点,即使是西方最廉价的防空导弹的成本也比其击落的“天竺葵”家族自杀无人机的成本高出数倍,对于爱国者导弹系统所配备的最昂贵的防空导弹来说,成本超支存在数量级的差距。 俄罗斯“天竺葵的生产已经接近完全本土化。根据国防科技大学公众号,“天竺葵”家族的第一架自杀无人机系直接对伊朗“见证者-136”重新涂装;此后,“天竺葵”自杀无人机的研制依赖所提供的机器配件自己组装,再同步进行对某些组件的本土化生产工作,以及对“天竺葵”系列自杀无人机结构的改进升级。截至2025年10月,俄罗斯“天竺葵的生产已经接近完全本土化,其设计构造已与伊朗原型机大不相同。根据中国国防报2025年报道,俄罗斯在鞑鞋斯坦拉布加工厂布局了两条700米全自动化生产线,全天轮班作业,推动“天竺葵-2”无人机年产量由2023年的约2000架提升至2025年近5000架,单价成本仅2万美元。根据乌克兰国防情报局下属War&Sanctions官网,天竺蒸列无人机相继推出“天竺葵-3/4/5”,自“天竺葵-3”起,无人机改型为喷气动力,采取涡喷发动机。 3.美国LUCAS无人机 美国通过对“见证者-136”的逆向研究推出LUCAS无人机。根据新华网,美军曾对一架“见证者-136”无人机进行检查和逆向测试,与一家总部位于亚利桑那州的公司合作开发出LUCAS无人机。 往期推荐阅读 往期热文(点击文章标题即 可 直 接 阅 读) : ]article_adlist--> 国内30+款固定翼无人机盘点 致导科技 QP530A丨实力拉满三重国标合规 ]article_adlist--> 美微波武器首破光纤无人机“无敌”神话 业内首创 | 富戈Fulgor三频段跳频抗干扰FPV数字图传 ]article_adlist--> 遥控脱钩器: 600kg载荷,0.34kg自重,极致载荷比 ]article_adlist--> ]article_adlist--> .appendQr_wrap{border:1px solid #E6E6E6;padding:8px;} .appendQr_normal{float:left;} .appendQr_normal img{width:100px;} .appendQr_normal_txt{float:left;font-size:20px;line-height:100px;padding-left:20px;color:#333;} 海量资讯、精准解读,尽在新浪财经APP

Sina finance 2026-06-13 相关度 8
冲突态势 高影响 今日

赴狮城擅飞无人机拍到军事区 泰摄影判罚1.5万新元

新加坡对外国摄影师擅闯军事区重罚,反映各国在敏感空域管控趋严。无人机技术普及使民间泄密风险陡升,相关立法与执法将成各国安全治理重点。

提示优先跟踪后续催化
查看摘录RSS 原始摘要

赴狮城擅飞无人机拍到军事区 泰摄影判罚1.5万新元

亚洲电视新闻 2026-06-13 相关度 6
冲突态势 高影响 今日

#军事# 新一轮的美伊互袭,冲突性质该如何界定?

美伊互袭却避免正式战争定性,反映双方均想控制升级。此类“灰色地带冲突”模糊国际法适用,将成大国博弈常见模式,传统外交回旋空间被持续压缩。

提示优先跟踪后续催化
查看摘录RSS 原始摘要

#军事# 新一轮的美伊互袭,冲突性质该如何界定?

搜狐网 2026-06-13 相关度 6
冲突态势 高影响 今日

#军事# 美伊协议难达成,冲突与对话或长期交织

美伊谈判破裂与军事对抗并行,说明双方战略互信严重缺失。对话与冲突长期交织将持续消耗地区稳定,中东局势更难预测,代理人战争与擦枪走火风险上升。

提示优先跟踪后续催化
查看摘录RSS 原始摘要

#军事# 美伊协议难达成,冲突与对话或长期交织

搜狐网 2026-06-13 相关度 6
冲突态势 高影响 今日

俄乌冲突时长超越一战 泥潭战持续四年

俄乌冲突超1569天、超过一战时长。普京坚持“特别军事行动”避免总动员、防社会崩溃,深陷历史教训:40%以上国防开支仍难速胜,持久战正考验后方经济与民众承受极限。

提示优先跟踪后续催化
查看摘录RSS 原始摘要

俄乌冲突时长超越一战 泥潭战持续四年

中华军事 2026-06-13 相关度 6

分类跟踪

15 条主线索
主题模块

冲突态势

5
冲突态势 中影响 今日

留疤了!巴尔韦德世界杯定妆照:与琼阿梅尼冲突留下伤痕清晰可见

留疤了!巴尔韦德世界杯定妆照:与琼阿梅尼冲突留下伤痕清晰可见

提示纳入冲突态势观察
查看摘录全文

直播吧06月13日讯 皇马球星巴尔韦德正代表乌拉圭队参加世界杯,官方定妆照中,巴尔韦德额头的伤痕清晰可见。

这个伤疤来自上个月皇马队内训练中爆发的冲突。据当时媒体报道,在与琼阿梅尼的争执过程中,巴尔韦德撞到桌子,额头被划出一道口子。

此事件最终以两名球员各被皇马罚款50万欧告终。

news.zhibo8.com 2026-06-13 相关度 4
冲突态势 中影响 今日

美伊冲突迎关键转折?传特朗普酝酿“分阶段”协议:先开放霍尔木兹海峡,后逐步解除制裁港美股资讯

美伊冲突迎关键转折?传特朗普酝酿“分阶段”协议:先开放霍尔木兹海峡,后逐步解除制裁港美股资讯

提示纳入冲突态势观察
查看摘录全文

热门资讯 > 正文 美伊冲突迎关键转折?传特朗普酝酿“分阶段”协议:先开放霍尔木兹海峡,后逐步解除制裁 2026-06-13 18:51 特朗普媒体科技集团(DJT) 0 标普油气勘探与生产ETF-SPDR(XOP) 0 Vectors石油服务ETF-VanEck (OIH) 0 智通财经APP获悉,全球资本市场正屏息等待本周末可能传来的一项历史性重磅消息。据白宫高级官员透露,美国总统唐纳德·特朗普正在酝酿一项针对伊朗的全新地缘政治协议。该协议的核心机制为“分阶段实施”,旨在通过率先重新开放战略要道——霍尔木兹海峡,来逐步缓解美伊之间长达数月的军事冲突,并为后续的核问题谈判腾出空间。 该协议预计不会对伊朗的核计划进行实质性处理,而是将该问题留待未来60天的谈判进程中解决。该协议将推动美国部分解除对伊朗的制裁,并可能使德黑兰新的强硬派领导层获得数百亿美元的冻结资金。 作为全球原油与天然气运输的“咽喉”,霍尔木兹海峡的重开预期已提前引发全球大宗商品市场的剧烈波动。市场分析人士指出,若协议在本周末顺利签署,此前因地缘冲突引发的“历史性石油供应危机”将迎来实质性转折,持续承压的全球能源价格与通胀也有望获得关键的减压阀。 协议的核心架构:先放行、后谈判、再奖励 根据媒体援引消息人士的报道,这份谅解备忘录的核心设计为分阶段实施机制:立即重新开放霍尔木兹海峡且不收取通行费,停火期限延长60天并扩展覆盖黎巴嫩,作为伊朗"履约束义务"的条件,获得分步制裁减免和资产解冻。备忘录中包含一个处理伊朗浓缩铀库存问题的框架,但任何实质性的核计划行动都将取决于60天谈判窗口期内另行达成的详尽的最终协议。 这一架构的实质是"先放行能源通道、再谈核问题"。与2015年《联合全面行动计划》(JCPOA)的先谈判、后履约、再解禁的"互惠并行"逻辑不同,本次谅解备忘录采取了相反的时间顺序——核武器这一特朗普政府发动战争的"核心理由",已被系统性推迟至未来两个月的谈判进程中解决。 一名美国政府高级官员在6月12日的电话吹风会上将美方的签署信心定调为"80%至85%"。该官员确认,初步协议内容包括重新开放霍尔木兹海峡并解除美国对伊朗的海上封锁,伊朗"承诺无限期地不再获取或研发核武器",关于如何移除伊朗高丰度浓缩铀库存的技术细节将在60天的"技术性"谈判中敲定,同时美方将放松大部分经济限制,使伊朗重新融入世界经济。 但关键问题在于:伊朗官方至今拒绝证实任何已达成最终协议的说法 伊朗外交部发言人巴加埃6月11日明确表示,"迄今为止,伊朗尚未就伊美协议达成最终结论,外界针对该协议传出的说法均为猜测"。伊朗国家电视台同日援引该发言人进一步指出,伊美协议大部分文本已经敲定,但美方不断改变立场,其矛盾立场阻碍了这一进程,霍尔木兹海峡局势也因美方行动变得更加动荡。 截至6月12日晚间,伊朗法尔斯通讯社援引一名接近谈判团队的消息人士的话,直接驳斥了"协议已最终敲定、计划于本周日在日内瓦签署"的说法,称之为"完全是无稽之谈"。两名知情人士也向媒体表示,截至目前,备忘录可能尚未得到伊朗最高领袖穆杰塔巴·哈梅内伊的最终批准。 同一时间,伊朗半官方媒体迈赫尔通讯社披露了一份据称正在敲定的14点谅解备忘录草案,内容包括美国解除对伊朗石油出口的制裁、释放约240亿美元冻结资产、美国承诺不干涉伊朗内政并从伊朗周边撤出军事力量,以及美国及盟国须就战争损失向伊朗提供至少3000亿美元的重建计划。特朗普随即在Truth Social上怒斥伊朗"故意散布虚假信息",称草案内容与双方实际达成的书面协议"毫无关系",并指责伊朗在谈判过程中"毫无诚信"。 国际危机组织伊朗项目主任阿里·瓦埃兹分析认为,特朗普的升级威胁一方面向国内强硬派展示"对伊强硬"姿态,另一方面实则为自己寻找"胜利式退场"。但核心困境在于,伊朗上周末首次直接袭击以色列,让美方意识到保卫以色列的代价已超出可控范围,迫使特朗普加速寻求"体面退出",然而"胜利光环"与"安全退场"之间的张力可能令协议落地前景变得异常复杂。 协议更像是战争暂停而非终止 从目前披露的信息来看,这份"谅解备忘录"是一份高风险的"暂停键"而非"终止符"。 对特朗普而言,它的时间窗口高度政治化——6月14日恰是其80岁生日,随后他将赴法国出席七国集团峰会。在共和党内部,协议已引发激烈分裂:参议员格雷厄姆和克鲁兹等强硬派质疑协议"让伊朗存活下来并继续控制霍尔木兹海峡"是"灾难性的错误",白宫则与蓬佩奥等前高官发生了公开言语冲突。政治计时器与外交文本的可行性之间存在结构性张力。 对伊朗而言,协议的设计使其可以在不做出实质性核让步的前提下,先行获得制裁解除和资产解冻。伊朗伊斯兰共和国通讯社披露的备忘录框架显示,伊朗"并未承诺放弃霍尔木兹海峡的管理权,也未承诺恢复到美以军事行动前的状况"。英国皇家国际问题研究所中东项目主任塞纳姆·瓦基勒对此评论道,目前双方依旧互不信任,不愿做出实质性让步,"任何将最关键问题拖延下去并附加条件的协议,都会让双方回到一个名义上脆弱的停火格局,随时可能因一方越线再次引爆对抗"。 保卫民主基金会首席执行官马克·杜博维茨更直接警告特朗普,必须谨慎行事,不要浪费其在接连军事打击伊朗后积累的影响力。"危险在于他们会先同意A拿到钱,再同意B拿到钱,然后同意C获得制裁豁免,之后就会拖延谈判进程,"杜博维茨说,"一旦陷入谈判泥潭又没有做好重返大规模军事行动的准备,那将是致命的。" "双重事实"下的能源市场:航行量回升、但价格未敢庆祝 市场对美伊协议的反应并非单一跌势,而是呈现出极具层次感的结构:霍尔木兹海峡通航量显著回升与油价基本面预警并存。截至当天收盘,纽约商品交易所7月交货的轻质原油期货价格下跌2.83美元,收于每桶84.88美元,跌幅为3.23%;8月交货的伦敦布伦特原油期货价格下跌3.05美元,收于每桶87.33美元,跌幅为3.37%。 据能源数据分析公司Vortexa数据,6月首10日,经霍尔木兹海峡外运的非伊朗原油日均至少达180万桶,较5月的约120万桶/日增长了50%。不过伊朗原油出货因受美国制裁影响几近停摆,同期未通过伊朗原油穿越海峡。此外,大量航运交易目前采用关闭自动识别系统应答器的"盲航"模式——5月这一通行方式曾占海峡总通行量的65.2%——能源贸易实际规模可能远高于公开监测数据。 美国能源部长克里斯·赖特周二已公开表示,霍尔木兹海峡的石油运输活动"非常显著地回升",并将"继续增长"。特朗普本人也披露美方上月已执行"秘密护航任务",协助约1亿桶原油(日均逾240万桶)安全通过海峡。 然而,即使通航恢复至目前水平,供应缺口仍旧惊人。冲突前霍尔木兹海峡日常承载约2000万桶/日的原油及成品油运输量,占全球石油海运量的20%。国际能源署数据显示,受海峡"梗阻"影响,海湾国家石油日产量较战前低1440万桶,累计供应损失已超12亿桶。 更值得警惕的信号来自美国能源信息署。EIA周二发布的最新《短期能源展望》预警,OECD国家石油库存正逼近2003年有记录以来的历史最低水平——预计12月将降至23亿桶以下,仅可满足50天全球需求,为2003年以来最低覆盖率。EIA首次预测2026年全球石油需求将出现年度萎缩,预计日均减少110万桶,这是自2020年新冠疫情冲击后首次由正转负。6月至7月布伦特现货均价预计达105美元/桶,较同期期货溢价显著,直观反映短期供应紧张格局在协议尚未落地之前仍难以扭转。 OPEC周四亦连续第二个月下调2026年全球石油需求增长预测至每日97万桶,远低于此前预期的117万桶。OPEC+产量在5月进一步萎缩,伊朗降幅最为显著,5月伊朗原油和凝析油出口量已降至至少六年来的最低水平。 面对这种"价格下行、基本面仍趋紧"的矛盾格局,摩根大通分析师指出,实际通过海峡的秘密运输量可能高于公开数据——目前或仍有约200万桶/日的原油通过关闭AIS的油轮秘密运出。而一旦美伊正式签署协议,若美国对伊朗的石油制裁随封锁一并解除,合规超大型油轮运力需求将急剧攀升,届时油运市场或将"一船难求"。

hstong.com 2026-06-13 相关度 4
冲突态势 中影响 今日

韩国科学技术院团队如何打造更公正的冲突仲裁评估体系

韩国科学技术院团队如何打造更公正的冲突仲裁评估体系

提示纳入冲突态势观察
查看摘录全文

新浪财经 股票 韩国科学技术院团队如何打造更公正的冲突仲裁评估体系 市场资讯 06.13 14:57 (来源:科技行者) 这项由韩国科学技术院(KAIST)与忠南国立大学联合开展的研究,于2026年6月4日以预印本形式发布在arXiv平台,论文编号为arXiv:2606.05563v1。研究的核心是一个名为SoCRATES的评估框架,专门用来测试AI调解员在真实复杂冲突中的表现。对这一领域有深入兴趣的读者可以通过上述编号在arXiv检索完整论文。 现实生活中,冲突无处不在。邻居之间为停车位吵得不可开交,公司与员工就薪资待遇谈不拢,甚至国与国之间因贸易政策剑拔弩张。调解这些纠纷本是专业调解员的工作,然而全球范围内,经验丰富的调解人才严重匮乏。于是,研究者们开始探索一个自然的问题:能不能让大语言模型(也就是像ChatGPT这类AI)来扮演调解员的角色,帮助两方甚至多方找到共识? 听起来颇有前景,但这里藏着一个棘手的难题。评判一场调解的好坏,远比判断AI下棋赢没赢复杂得多——调解过程中,双方情绪会起伏变化,策略会随时调整,背景信息错综复杂,每一个时机点的干预方式都可能影响最终结果。换句话说,调解没有标准答案。现有的测试方法要么场景过于简单,要么评分方式粗糙,根本无法真实反映AI调解员在复杂现实中的能力。KAIST团队正是为了解决这一痛点,设计了SoCRATES这套全面的评估体系。 一、为什么现有的测试方法远远不够 要理解SoCRATES的价值,首先得弄清楚之前的研究究竟遇到了哪些瓶颈。 现有的AI调解测试台,通常依赖少数几位专家手工编写的冲突场景,就像一个厨师只用三道菜来考核一位主厨。这种方式不仅费时费力,覆盖的冲突类型也极其有限,往往集中在商业谈判或法律纠纷这两个领域,对医疗、环境、国际关系等其他领域几乎视而不见。 再者,真实冲突会沿着多个维度同时变化。当你处理一场谈判时,对方可能是情绪激动的愤青,也可能是冷静克制的老手;可能来自强调集体主义的文化背景,也可能来自极度个人主义的环境;双方之间可能积累了多年的恩怨,也可能是初次接触。这些因素像不同的调味料,会让同一道菜呈现出截然不同的口味。然而,以往的研究只是改变了谈判策略这一个变量,把其他所有影响因素混在一起,导致研究者根本搞不清楚AI在哪个环节出了问题。 评分方式同样存在严重缺陷。一种常见的方法叫做"逐轮评分",也就是在对话的每一个回合,用AI裁判对所有议题逐一打分。问题在于,任何一场谈判中,某个时刻双方可能只在讨论薪资问题,根本没有提到福利待遇,但评分系统仍然对福利待遇这个议题打了一个分数。这就像你在测量某人的血压,却把体温计的读数也算了进去——噪音会把真实信号淹没,而且这个错误还会随着对话的推进不断积累放大。 由此,KAIST团队确立了三个必须同时解决的挑战:如何在不依赖人工的情况下,大量生成真实可信的冲突场景;如何独立地测试AI在各种社会认知维度上的能力;以及如何在整个对话过程中进行既准确又抗干扰的评分。 二、SoCRATES的核心设计:一套三阶段的"冲突模拟器" 为了应对上述挑战,研究团队设计了一套三阶段的流水线式体系,每个阶段都有其独特的功能,三者合力才能完成对AI调解员的全面考核。 **第一阶段:让AI自己去搜集真实纠纷案例** 传统方法靠人工编写场景,这条路走不远。KAIST团队换了一种思路——让AI自己充当侦探,去互联网上搜索真实发生过的公开冲突案例。 具体来说,他们使用了一个叫做"深度研究"的搜索智能体(基于OpenAI的o4-mini模型),向它布置任务:在八个不同的冲突领域中各自搜寻真实案例。这八个领域分别是商业交易纠纷、医疗卫生纠纷、环境争议、企业间商务纠纷、公共政策冲突、国际关系争端、法律诉讼以及组织内部矛盾。每个领域的代表性场景各不相同,就像食材的种类决定了菜品的风味。 搜索智能体找到候选案例后,会将它整理成包含关键事件时间线、利益相关方、核心争议点和机构张力等要素的种子报告。接着,另一个智能体(使用GPT-5.4模型)接手这份报告,把它改写成一个可以直接运行模拟的结构化场景。改写时有几条硬性规定:所有真实的人名、机构名、地名都必须用虚构的替代品替换,以保护隐私;每个场景最多设置四个谈判议题,每个议题有若干具体选项可供双方选择,而不是漫无边际地自由发挥;至少要有一个议题在情感上是高度敏感的。 改写完成后还有最后一道关卡:对场景进行"压力测试"。研究团队让AI模拟两方在没有调解员介入的情况下自行谈判,如果三次模拟中每次双方都能自己谈拢,那这个场景就被淘汰——因为太容易解决的纠纷没有测试价值。只有那些在无人调解时三次都陷入僵局的场景,才会被保留下来,最终形成一个由四十个"硬核"场景构成的测试库,每个领域各五个。 **第二阶段:沿着五条轴线,独立拨动每一个变量** 有了场景库之后,接下来的挑战是如何模拟真实冲突的多样性。研究团队提炼了五个最能影响调解结果的社会认知维度,并把它们称为"五条轴线"。 第一条轴线是谈判策略倾向。参照心理学中经典的冲突处理理论,团队将每场谈判中双方的策略设定为三种模式之一:竞争型(只顾自己利益,寸步不让)、回避型(不想直面冲突,消极应对)或顺从型(处处让步,迁就对方)。这相当于测试调解员面对不同性格类型谈判者时的应变能力。 第二条轴线是参与方数量。大多数研究只考虑两方对立的情形,但现实中往往有第三方甚至更多方介入。SoCRATES通过增加一个由AI自动生成的第三方,来测试调解员追踪多方状态的能力,考验其同时处理多条矛盾线的本事。 第三条轴线是历史背景的复杂程度。有些冲突是临时起意,有些却积累了数年乃至数十年的恩怨情仇。研究团队通过将场景的历史背景扩展到原来的五倍长度,测试AI在处理大量历史信息时是否还能抓住重点,准确理解当前局势。 第四条轴线是情绪激动程度。两位谈判者被赋予从0(极度冷静)到1(极度激动)的情绪强度参数。研究中使用了组合——两人都冷静、一人冷静一人激动、两人都极度激动——来测试AI面对情绪化场面时的调节能力。 第五条轴线是文化身份。每位谈判者被绑定到美国、中国或韩国的文化背景,具体通过霍夫斯泰德文化维度模型(一套衡量国家文化差异的经典工具)来编码:权力距离、个人主义程度、男性化程度、不确定性回避、长期导向和放纵程度,六个维度的分数拼出一张文化画像,附在谈判者的角色描述中。为了把文化因素和语言因素分开,所有参与者都被要求用英语交流。三种文化两两配对,形成三种同文化组合和三种跨文化组合,共六种情形。 五条轴线加上基础场景,一共形成十五种测试条件。而且,每一次都是单独改变其中一条轴线,其余保持不变,这样如果AI的表现下滑,研究者就能精准地锁定是哪条轴线造成了麻烦,而不是茫然地猜测。 **第三阶段:只在"关键时刻"打分的评分机制** SoCRATES的评分方法是整个体系中最具创新性的部分,它的核心思想用一句话概括就是:只在相关的时刻为相关的议题打分。 对于场景中的每一个议题,评分系统会先通读整段对话,然后找出双方真正在讨论这个议题的那些回合——要么是有人主动提到它,要么是某一方的立场发生了变化。在这些"关键时刻",系统记录一个共识程度的分数(1到5分)以及双方各自的立场选项。在不讨论这个议题的其他时间,分数就直接沿用上一次记录的值,不做任何更新。 这就像给病人测血压,你不会在他睡着时每隔一分钟量一次,而是选择在他进行体力活动前后这样的"有意义时刻"去测量,这样得到的读数才能反映真实变化。 在这套评分机制之上,SoCRATES定义了三个衡量调解员表现的指标。第一个叫"共识增益",衡量调解员有没有整体上帮助双方缩小分歧——具体做法是比较有调解员和没有调解员时的最终共识程度,再除以无调解状态下的剩余分歧空间,得出一个百分比。如果这个数字是100,代表调解员完全弥合了分歧;如果是负数,则意味着调解员的介入反而让情况变得更糟。第二个叫"干预及时性",考察调解员是否在局势恶化时迅速出手。当共识分数在一个回合内下降超过0.1,系统就标记为一个"滑落事件",然后看调解员是否在接下来的10个回合内采取了行动。越早行动,得分越高。第三个叫"干预有效性",衡量调解员每次说话之后的五个回合内,共识程度提升了多少,并用"当前剩余分歧空间"做归一化处理,避免在双方已经接近共识时虚高评分。 三、验证:这套评分系统真的比人类外行更准吗 设计再好的系统,如果不能被验证,也只是空中楼阁。研究团队对SoCRATES的两个核心组件分别进行了严格的验证实验。 **验证情绪模拟是否可靠** 首先要确认的是:当你给AI谈判者设定一个情绪强度参数,它的行为真的会随之改变吗?研究团队测试了七个不同的AI模型作为谈判者模拟器,给每个模型分配四种情绪强度(0、0.33、0.66、1),生成对应的对话,然后招募亚马逊众包平台上的标注人员,两两比较哪段对话中的谈判者更情绪激动。 测试结果相当清晰。七个模型中,DeepSeek-V3.2的表现最为出色,在160对比较中,标注者对其情绪强度排序的识别准确率达到了87.2%。换句话说,当你把情绪旋钮拨高,DeepSeek-V3.2扮演的谈判者确实会表现得更加激动,这种变化稳定可辨,具有良好的可控性。因此,研究团队选择DeepSeek-V3.2作为所有模拟实验中谈判双方的扮演者。 **验证评分系统是否接近专家判断** 第二项验证针对的是评分系统本身。研究团队邀请了两位来自政治科学和国际关系背景的研究生,对1844个对话片段逐一打分,这两位标注者最终达到了Krippendorff's α = 0.86的一致性水平(这是一个衡量不同评判者意见吻合程度的指标,越接近1代表越一致,0.86属于相当高的水平)。他们的平均分数成为衡量评分系统好坏的基准。 与此同时,研究团队还测试了两种对照方法:一种是让没有专业背景的众包标注者完成同样任务;另一种是使用之前同类研究(ProMediate)采用的"逐轮打分"方式。 对比结果非常有说服力。SoCRATES的评分系统在"对话轨迹层面"与专家的皮尔逊相关系数达到了0.82,在"最终结果层面"达到0.80。相比之下,ProMediate的逐轮评分在这两个层面分别只有0.372和0.432,非专业标注者的成绩则是0.331和0.527。SoCRATES的得分是逐轮评分方法的两倍有余,这种差距在统计上极为显著,p值均趋近于0。 研究团队还特地画出了两种评分方法的评分轨迹曲线图,直观地呈现了差异:SoCRATES的评分曲线从低到高稳定上升,与专家打分趋势高度吻合;ProMediate的曲线则像心电图一样剧烈波动,时高时低,起点已经虚高,终点又远低于专家判断。这正是"无关议题注入噪音"问题在现实中留下的痕迹。 研究团队还用另一个大模型(Qwen3-235B)替换原有的评分骨干模型,检验结果是否会随之崩塌。换骨干后,SoCRATES在轨迹层面的相关系数仍有0.785,结果层面为0.721,依然远超ProMediate,说明这套评分逻辑本身是稳健的,不依赖特定的大模型。 四、八位AI调解员的大考成绩单 有了可靠的场景和评分系统,KAIST团队用SoCRATES对八位来自不同家族的AI模型进行了全面基准测试。这八位候选者中,有来自谷歌的Gemini-3.1-Flash-Lite和来自OpenAI的GPT-5.4-mini两个商业闭源模型,以及DeepSeek-V3.2、Qwen3-235B、Nemotron-3-120B、Solar-Pro-3、Gemma-4-26B和Qwen3-30B六个开源模型。 每位调解员要完成的任务量相当惊人:40个场景乘以15种测试条件,共600场对话。八位候选者加在一起,总计产生了4800场对话,每场都配有相应的无调解员对照组。 **整体成绩:没有人能及格** 从共识增益这个最重要的指标来看,没有任何一位AI调解员的表现堪称优秀。最强的候选者(Gemini-3.1-Flash-Lite和GPT-5.4-mini)的平均共识增益约在33到34之间,这意味着他们大约只弥合了三分之一的分歧——换句话说,如果没有调解员时双方的共识程度是0.5,有了最好的AI调解员之后,也只能把共识推进到大约0.67,距离完全解决冲突还有很长的路要走。最弱的候选者共识增益甚至只有15至16,约莫只有最强者的一半水平。 这一结果与此前一些研究报告的"解决率80%至90%"形成了鲜明反差。KAIST团队指出,那些高数字往往来自单一领域、未施加社会认知压力的简单测试,而SoCRATES的多领域、多轴线设计让这些数字不攻自破。 **商业模型有优势,但规模不是万能药** 两个商业闭源模型的共识增益比最强的开源模型高出约1至2.5个百分点,在八个冲突领域中的六个里都取得了领先。然而,令人意外的结论是:模型规模本身并不是调解能力的保证。 以Qwen3家族为例,2350亿参数的Qwen3-235B几乎是300亿参数的Qwen3-30B共识增益的两倍,说明在同一家族内部,规模确实有帮助。但跨越不同家族的比较则完全打乱了规模排名——拥有1200亿参数的Nemotron-3-120B,在法律和组织内部冲突领域的表现还不如260亿参数的Gemma4-26B,尽管前者的参数量是后者的四五倍。这清楚地表明,调解这种高度依赖社会认知的任务,并非单靠堆叠参数就能解决的。 **干预时机和干预质量是两回事** 测试中浮现了一个有趣的悖论。Solar-Pro-3和Qwen3-30B在"干预及时性"这个指标上得分最高,在八个模型中名列前茅。但翻到共识增益这一栏,它们却排在倒数。原因是什么?研究团队发现,这两个模型会在约三分之一的双方发言回合中插入调解语句,干预频率大约是表现最好模型的两倍,而且它们总是提前很早就开口。频繁早期插话让它们在"及时性"指标上占了便宜,却没有带来真正有意义的共识推进。 这就好比一个法庭速记员,记录每一个字都又快又准,但真正能影响判决走向的,是律师在关键时机说的那些话,而不是速记员的手速。好的调解员必须既快又准,缺一不可。 **领域差异揭示了测试设计的必要性** 八个冲突领域之间的表现差距极大。AI调解员在商业交易纠纷中的平均共识增益高达41.3,在组织内部冲突中则跌至16.6。这个巨大的落差恰好印证了一点:大多数现有冲突数据集高度集中于商业谈判场景,如果只在这类场景上测试AI,会大大高估其实际能力。组织内部冲突之所以更难,是因为它涉及情感依附、权力层级和非正式规范,这些都是AI难以准确感知的微妙因素。 五、五条轴线的精准诊断:哪里强,哪里弱 当研究团队把五条轴线的测试结果画成雷达图,每位AI调解员在五个维度上的实力与弱点立刻变得一目了然。 从整体趋势来看,商业模型和Qwen3-235B的雷达图面积最大,说明它们在大多数维度上都表现更好。然而,几乎没有任何一个模型在所有五条轴线上都保持稳定。即便是整体排名相近的GPT-5.4-mini和DeepSeek-V3.2,在"多方状态追踪"这条轴线上的下滑幅度也远超Gemini-3.1-FL和Qwen3-235B。这说明调解能力并不是一个单一的"强弱"问题,而是由多个相对独立的能力组成的。 **谈判策略是最严峻的考验** 五条轴线中,谈判策略倾向对AI调解员的冲击最为剧烈。当双方都采取竞争型策略时,所有模型的共识增益下滑幅度在18.9到64.1个百分点之间;当双方都是顺从型时,下滑幅度同样在13.8到66.8个百分点之间。 特别值得注意的是Qwen3-235B。它的整体排名靠前,但在这两种策略条件下的下滑幅度却是所有模型中最大的。这说明它在基础场景中表现出色,但遇到高度对抗性或高度顺从性的谈判格局时,会出现严重的能力断崖。换句话说,Qwen3-235B的"平均分"掩盖了它在极端情况下的脆弱性。 **情绪管理:拼的不是体量** 情绪激动程度这条轴线的测试结果同样出人意料。当双方都保持冷静时,大多数模型的得分与基础场景相差不大。但当双方都处于极度激动状态时,所有模型的表现都有所下滑。更关键的是,下滑幅度与模型参数量之间没有明显规律——小模型未必比大模型更容易被情绪左右,说明"吸收情绪波动"是一种相对独立的能力,与模型的整体规模关系不大。 **文化距离产生系统性偏差** 文化身份这条轴线的结果虽然在五条轴线中对共识增益的冲击最小,但最为系统化。总体规律是:文化背景与美国越相近,AI调解员的表现就越稳定;当双方都带有东亚文化背景(中国或韩国)时,所有模型的表现都有一定幅度的下滑。从霍夫斯泰德文化理论的角度来看,所有受测的AI调解员似乎对以个人主义和直接表达为特点的美国文化价值观更为熟悉,而对强调集体主义、权力距离和含蓄共识的东亚文化模式则明显不够适应。 **"何时出手"同样需要随机应变** 研究团队还深入分析了不同测试条件下,调解干预有效性如何随对话进程演变。结果显示,最佳干预时机并非固定不变,而是随着测试条件的不同而移动。 在谈判策略测试和情绪激动测试中,有效干预集中在对话早期——因为策略立场和情绪状态一旦固化,就很难被撼动,因此调解员必须在双方还未陷入僵局之前就率先重新框架问题或冷却情绪。相反,在多方追踪和长历史背景这两类测试中,干预有效性随着对话进展而升高,在后期达到峰值。这是因为随着越来越多的信息被揭示,调解员在后期进行信息整合和总结梳理,反而能产生更大的推进效果。 表现最优的调解员都显示出一个共同特征:它们的干预有效性曲线与各测试条件的最佳窗口高度契合。GPT-5.4-mini在策略和情绪类测试中早期发力明显;Qwen3-235B则在多方追踪和长背景类测试中后劲十足。反观表现较弱的模型,它们的曲线几乎是平的,无论遇到什么情况都用同一种节奏干预,完全不顾对话所处的阶段和面临的具体挑战。 六、实验设计的严谨性:三重稳健性验证 为了确保实验结论不是偶然现象,研究团队从三个不同角度对结果进行了稳健性验证。 第一重验证是更换评分用的大模型。将DeepSeek-V3.2替换为Qwen3-235B来重新评分,结果发现三个指标的平均值仅分别偏移了负2.0、正3.9和正0.6个百分点,模型之间的排名顺序在干预有效性(Spearman相关系数0.862)和共识增益(0.786)两个指标上高度吻合,说明评分结果不依赖特定评分模型。 第二重验证是更换谈判双方模拟器。选取三个代表性调解员(Qwen3-235B、DeepSeek-V3.2、Qwen3-30B),将DeepSeek-V3.2谈判模拟器替换为Qwen3-235B模拟器,重新运行完整的600场对话。尽管绝对数值有所变动,但三个调解员在五条轴线上的相对表现模式得到了保留,主要结论依然成立。 第三重验证是多次运行取平均。对所有八个调解员在基础场景下重复运行三次,用Kendall's W统计量衡量三次运行的排名一致性,得到0.929的高度一致结论,说明实验结果不是某次随机波动的产物。 归根结底,SoCRATES这项研究告诉我们:当前最强大的AI调解员,在面对多样化、复杂化的现实冲突时,只能弥合大约三分之一的分歧,距离真正替代人类专业调解员还有相当长的距离。更重要的发现在于,这种差距并不是均匀分布的——AI调解员并非"整体能力不足",而是在某些社会认知维度上出现了明显的短板,比如面对竞争型谈判者时的策略调整、吸收情绪波动的韧性、以及对东亚文化背景的理解。 这意味着,未来改进AI调解员的关键,不在于单纯提升模型的通用智能,而在于有针对性地强化这些特定的社会适应能力。SoCRATES提供的正是这样一张精确的诊断地图,让研究者知道该在哪里用力。对于那些对AI在人类冲突解决领域的潜力与局限感兴趣的读者,这套评估框架本身也是一个值得深入研究的工具。原论文可通过arXiv编号2606.05563查阅完整内容。 Q&A Q1:SoCRATES评估框架和之前的AI调解评估方法有什么核心区别? A:之前的方法(如ProMediate)会在每一个对话回合对所有议题逐一打分,导致大量无关内容注入噪音,误差会不断累积。SoCRATES的"主题定位评分"只在议题被实际讨论或立场发生变化的时刻才更新分数,其余时间沿用上次记录。这种设计让评分更贴近真实共识状态,与人类专家的皮尔逊相关系数达到0.82,是传统逐轮评分方法的两倍以上。 Q2:SoCRATES测试的五条社会认知轴线分别是什么,哪条对AI调解员冲击最大? A:五条轴线分别是谈判策略倾向、参与方数量、历史背景复杂度、情绪激动程度和文化身份。其中谈判策略冲击最大,当双方都采取竞争型或顺从型策略时,所有模型的共识增益下滑幅度最高可达64个百分点以上。文化身份的冲击相对最小,但最为系统化,所有AI调解员在东亚文化背景下的表现都比美国背景下明显偏弱。 Q3:当前最强的AI调解员到底能解决多大比例的冲突分歧? A:在SoCRATES的多领域、多条件测试下,表现最好的模型(Gemini-3.1-Flash-Lite和GPT-5.4-mini)平均共识增益约为33至34,也就是说大约只能弥合三分之一的分歧。没有任何模型接近满分100。这与此前一些单一领域测试报告的80%至90%解决率形成了巨大反差,说明之前的高数字很大程度上来自过于简单的测试环境。 window.STO=window.STO||{};window.STO.fw=new Date().getTime(); 相关新闻 --> 推荐阅读 --> 加载中... 视频 直播 美图 博客 看点 政务 搞笑 八卦 情感 旅游 佛学 众测 首页 导航 反馈 登录 Sina.cn(京ICP证000007) 2026-06-13 20:01

新浪财经 2026-06-13 相关度 4
冲突态势 中影响 昨日

“国防”到“战争”又近一步,民主党:浪费钱-观察者网

“国防”到“战争”又近一步,民主党:浪费钱-观察者网

提示纳入冲突态势观察
查看摘录全文

美《华盛顿邮报》6月11日报道,为推动特朗普政府将国防部更名为“战争部”的主张,有关条文被加在一份“必须获批”(must-pass)的法案中。

参众两院军事委员会均在各自版本的《国防授权法案》中写入了这项条款,这份国防政策法案拟批准高达1.15万亿美元军费开支。

过去一周,参众两院军事委员会均完成了各自法案文本的初审推进。以往该法案基本能获得两党共识,但本次民主党对法案的支持率大幅下滑。目前参众两院各自的法案文本均尚未在全院表决通过,两院版本需先协调统一,预计今年晚些时候才会举行最终投票。

尽管如此,由共和党掌控的两大军事委员会表态支持,意味着距离美国防部更名战争部的构想写入法律,又迈进了关键一步。

目前,五角大楼已更换标牌、邮件签名与社交媒体标识,统一适配新名称。当前官方公文中只将“战争部”作为次级称谓使用。若要彻底完成法定更名,仍需国会批准。

支持更名的共和党议员称,“战争部”这一名称更贴合该机构核心使命。

民主党议员则反驳称,此次更名只是徒耗资金的表面形象工程。

本文系观察者网独家稿件,未经授权,不得转载。

观察者 2026-06-12 相关度 5
主题模块

国防政策

5
国防政策 中影响 今日

指责首相未能足额拨款,英国防大臣宣布辞职

指责首相未能足额拨款,英国防大臣宣布辞职

提示纳入国防政策观察
查看摘录RSS 原始摘要

指责首相未能足额拨款,英国防大臣宣布辞职

凤凰网 2026-06-13 相关度 4
国防政策 中影响 昨日

药明康德起诉美国国防部要求撤销军工企业认定

药明康德起诉美国国防部要求撤销军工企业认定

提示纳入国防政策观察
查看摘录全文

【#药明康德称已起诉美国国防部##药明康德对美国国防部提起诉讼#】6月12日盘前,药明康德发布公告称,2026年6月11日(美国时间)公司已在美国哥伦比亚特区联邦地区法院对美国国防部提起诉讼。公司坚信,美国国防部依据第1260H条款将药明康德列为“中国军工企业” (CMC)的决定是错误的, 而且缺乏事实依据或适用法规和判例法下的法律标准支持。 为保护公司客户、 合作伙伴、 员工及股东的利益,公司已向法院请求, 包括但不限于:(1) 宣告国防部将药明康德认定为CMC的决定无效、作废且不具任何法律效力;(2)撤销并废除将药明康德认定为CMC的决定;(3)将药明康德从1260H名单中移除。

新浪财经头条意见反馈留言板

4001102288 欢迎批评指正

新浪财经 2026-06-12 相关度 5
低优先级归档0
暂无低优先级归档

来源覆盖

按出现次数排序
搜狐网4
新浪财经2
Sina finance1
cn.qdnd.vn1
hstong.com1
news.zhibo8.com1
中华军事1
亚洲电视新闻1
凤凰网1
观察者1
信息说明:以上内容为 RSS 聚合抓取,M3 总结和分类仅供参考。原始摘要、全文摘录和链接已尽量保留,请自行核实。重要决策需参考多方信息源。