AI 论文精读|每日精选论文


Channel's geo and language: China, Chinese
Category: Telegram


每日精选 AI 论文中文精读:大模型、多模态与前沿研究,一篇讲清方法、结论与它为什么重要。
📮 投稿/合作 @cangqilai123

Related channels

Channel's geo and language
China, Chinese
Category
Telegram
Statistics
Posts filter


用进化策略微调长程智能体,低显存也能全参数优化

这篇论文提出 Agentic ESOpt,用进化策略替代强化学习来微调长程 LLM 智能体,只需推理级显存即可完成全参数优化,在 WebArena-Lite 上让 Qwen-3.5-27B 相对 No Skill 基线提升 6.69%。

长程智能体推理面临两个难题:轨迹分支越来越多、奖励稀疏,这让强化学习的短板被放大——基于反向传播的训练栈太重,难以微调更大的 LLM;轨迹变长后,信用分配也变得更困难。论文认为,进化策略(ES)是比 agentic RL 更适合长程智能体微调的选择,并给出三点理由:一是模型可扩展性,ES 只需推理级 GPU 显存就能做全参数优化,让大模型微调成为可能;二是灵活性,轻量黑盒反馈接口让 ES 微调容易与提示词空间进化组合,比如技能优化和测试时计算;三是长程可扩展性,ES 在轨迹层面做参数归因,无需跨时间步分解奖励,随着轨迹变长,扩展性优于 agentic RL。

基于这一思路,论文提出 Agentic ESOpt,一个面向参数与上下文协同进化的全参数智能体微调框架。每一步,它在当前 LLM 参数周围采样扰动,用奖励评估生成的智能体,再应用在线奖励加权更新。为了平衡探索与适应,框架引入扰动尺度 σ 的余弦衰减调度。

实验方面,在 WebArena-Lite 上,Qwen-3.5-27B 的全参数优化相对 No Skill 基线提升 6.69%。在测试时自动启发式设计任务中,Agentic ESOpt 做在线提示词与参数协同进化,在 36 个设置中的 28 个上超过匹配基线。


这项工作为长程智能体微调提供了强化学习之外的新路径,尤其适合显存受限但需要全参数优化的场景,也为提示词与参数的联合进化打开了空间。

#AI论文 #机器学习 #AgenticESOpt #进化策略 #LLMAgent #微调 #Qwen
@AIPaperCN




多奖励强化学习新方法:把优化留给还没学会的目标

现有方法用固定权重合并多个奖励目标,会让已解决的目标继续占用训练资源。SA-MRPO 按目标饱和程度动态调整权重,把梯度预算重新分配给仍有提升空间的目标,在数学、自适应推理和代码任务上均超过基线。

强化学习配合组内相对优势已成为语言模型推理能力后训练的主流范式。但当面对多个奖励目标时,现有方法通常先用固定加权和把奖励向量标量化,再做组内标准化。论文指出这种设计带来两个根本问题:具有不同奖励分布的 rollout 可能获得完全相同的优势值;所有目标都按固定相对权重优化,完全不考虑各自当前的饱和程度。结果是训练持续把梯度预算分配给已经解决的目标,而不是留给提升空间更大的目标。

为此作者提出 Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization(SA-MRPO)。该方法对每个奖励目标独立做标准化,并根据批级别的目标饱和估计自适应地折扣其贡献,从而动态地把优化努力重新分配给尚未充分优化的目标,同时经验上保持已满足目标的性能。论文进一步证明,饱和感知的权重重分配可以反转更新的符号,而不只是缩放其幅度。

实验覆盖多个任务。在数学推理的二元和三元奖励组合中,SA-MRPO 在 15 项基准对比里有 12 项优于 GDPO 的更难正确性目标,AIME24 上最高提升 5%。在自适应推理任务上,五个基准全部提升准确率,平均提升 3.8%,AMC23 上最高达 9.2%。代码基准的通过率最高提升 2.3%。所有设置下,较容易的目标都维持在已满足水平附近。


这项工作把多奖励优化从固定权重转向动态分配,让训练资源流向尚未掌握的能力,为推理模型的多目标后训练提供了更精细的调控思路。

#AI论文 #机器学习 #SAMRPO #多奖励优化 #强化学习 #RLHF #推理模型
@AIPaperCN






权威解析框架:五域本体论治理AI决策权

随着AI系统自主行动能力不断增强,判断智能体是否具备执行某项行动的技术能力已远远不够——系统还必须确认该行动在其所处情境中是否获得授权。本文提出权威解析框架(ARF),一个五域本体论,用于在组织角色与非正式影响力、业务概念、编码化流程、机器可读权限与可执行系统,以及外部现实世界情境之间表示和解析权威。

ARF将权威关系(AR)定义为跨域原语,绑定行动者、行动、对象、受限情境、论证链,以及一个名为DNA系数的校准度量——该系数捕捉文档化权威结构与实际运作中权威之间的偏差。框架提供权威来源和范围的机器可解释表示,包含JSON-LD表示形式和用于权威解析的知识图谱查询模式。

ARF旨在支持AI智能体在执行关键行动之前确定权威的来源、范围和情境有效性。该框架将权威解析定位为知识表示与推理问题,处于本体工程、语义AI、智能体AI和AI治理的交叉点。


这项工作的意义在于为AI系统提供了一种结构化的方式来判断"谁有权做什么",填补了AI治理中授权验证的关键空白。对于构建需要执行敏感操作的企业级AI智能体的开发者,ARF提供了一套可落地的权威建模与查询方案,值得关注。

#AI论文 #机器学习 #权威解析 #本体论 #AI治理 #智能体AI #知识图谱
@AIPaperCN






用深度学习破解史前手印的性别之谜

这项研究提出一个不确定性感知的深度学习框架,用于推断旧石器时代手印模板的生物学性别,并首次将不确定性作为可测量的考古推断组成部分。

史前手印的性别判定长期面临三大难题:缺乏真实标注、当代与史前人群的体质差异、图像退化带来的不确定性。传统形态测量方法在性别间结构重叠度高、跨人群泛化能力差,且依赖主观特征工程。

该框架显式地在整个分析流程中建模、传播并聚合不确定性。方法结合双图像处理、双轮廓提取、结构化剪影增强、模型架构多样性和集成决策聚合。每个手印模板生成十二种可能的剪影实现以捕捉边界不确定性,交由两个各含十个深度神经网络的集成处理,分别基于EfficientNet-B3和MobileViT-S架构,训练数据为14,036个当代手部样本。

验证环节采用三角化方案,将集成预测与无监督二维潜空间流形映射(UMAP加k-NN)以及可解释AI空间归因(LayerCAM)结合,确保解剖一致性。在当代数据上,集成模型在较大年龄组中分类准确率超过88%。应用于史前手印时,框架同时输出性别预测和内部一致性置信度,可区分形态稳定与模糊案例。

集成预测、潜空间结构和可解释性分析的收敛表明,不确定性可以成为考古推断的可测量组成部分,为古代岩画的稳健可复现解读提供新路径。


这项工作为考古学引入量化不确定性管理的深度学习范式,尤其适合样本稀缺、标注缺失的古代遗存分析场景。

#AI论文 #机器学习 #EfficientNet #MobileViT #不确定性量化 #考古AI #可解释AI
@AIPaperCN














AutoDesign:让智能体在长周期任务中自我迭代优化

将多模态素材转化为结构化媒体产物,本质上可视为一个以模型-框架系统为核心的长期智能体过程。理想的框架系统应契合人类设计先验,并通过经验积累实现递归式自我改进,但现有范式多为静态设计,缺乏这一能力。本文提出AutoDesign框架,通过元框架优化器引导代码智能体基于反馈递归改进框架,并在学术论文转海报任务中验证其有效性。

详细解读

研究团队将多模态内容转化为结构化媒体的过程,抽象为长周期智能体任务,核心在于模型与框架系统的协同。一个理想的框架系统需要满足两点:一是符合人类设计偏好,二是能通过实践积累可复用经验,驱动自我改进。然而现有系统多为固定范式,无法实现这一闭环。

AutoDesign的核心思路是引入元框架优化器,它像一个“教练”,观察代码智能体在任务中的表现,基于执行反馈指导其改进底层框架。这种递归优化机制使系统能够从每次尝试中学习,逐步逼近更优的设计策略。

为验证框架有效性,团队聚焦“学术论文转海报”这一具体任务,构建了PosterBench基准,包含覆盖五个学科的100篇论文主测试集,以及10篇论文的mini子集用于受控对比。在主测试集上,AutoDesign取得78.32分的最高成绩,超越闭源商业系统Claude Design达7.45分。在七种受控代码智能体模型配置下,集成学习到的DesignHarness均能稳定提升性能,平均得分从54.99升至67.39,增幅12.4%。

在完全自主的长周期运行中,AutoDesign在40分钟内执行253次工具调用和11轮编辑,成本不足3美元,生成结果达到会议海报平均质量水平。系统盲测人类偏好研究进一步显示,AutoDesign在多个评估系统中获得最高的人类偏好率。


意义与启发

这项工作的价值在于将“自我改进”从模型参数层面拓展到系统框架层面,为长周期智能体任务提供了一种可落地的优化范式。其低成本、高效率的特性,对自动化内容生产、多模态设计等场景具有直接参考意义。

#AI论文 #机器学习 #AutoDesign #智能体 #多模态 #海报生成 #PosterBench
@AIPaperCN






DreamFly:为空中视觉语言导航引入因果记忆与滚动扩散规划

空中视觉语言导航要求智能体在部分可观测条件下,随时间整合视觉证据、规划未来动作,并判断是否到达导航目标。尽管近期VLA模型提供了从感知到动作的可行范式,但受限于历史上下文不足、规划视野短以及隐式终止不可靠,将其适配到空中导航仍有挑战。为此,我们提出DreamFly,一个基于Dream-VLA的扩散式空中VLN框架。DreamFly引入因果对齐的历史记忆,仅利用当前决策步骤之前的观测来增强当前视觉表征,实现时间推理且避免未来信息泄漏。我们进一步将导航建模为滚动时域扩散规划,策略预测K步动作块但仅执行第一步后重新规划。这种“规划K步、执行一步”的策略,将未来动作作为辅助规划目标,同时保留闭环视觉反馈。最后,LiteStop直接从初始全掩码状态的动作logits估计停止概率,将显式终止与动作生成解耦。在OpenFly基准上的实验表明,在可见与不可见环境中均取得一致提升。DreamFly在测试可见/不可见分割上分别达到32.04%/29.46%的SR和28.22%/23.54%的SPL,两项指标均优于所有对比方法,并取得最低导航误差。这些结果验证了联合建模历史上下文、未来动作结构与显式终止对空中VLN的有效性。

空中视觉语言导航(VLN)要求智能体在部分可观测条件下,随时间整合视觉证据、规划未来动作,并判断是否到达导航目标。尽管近期VLA模型提供了从感知到动作的可行范式,但将其适配到空中导航仍面临历史上下文有限、规划视野短、隐式终止不可靠等挑战。

针对这些问题,DreamFly框架引入三项核心设计。第一,因果对齐的历史记忆模块,仅使用当前决策步骤之前的观测来增强视觉表征,支持时间推理且避免未来信息泄漏。第二,滚动时域扩散规划策略,预测K步动作块但只执行第一步后重新规划,以未来动作作为辅助规划目标,同时保留闭环视觉反馈。第三,LiteStop模块直接从初始全掩码状态的动作logits估计停止概率,将显式终止判断与动作生成解耦。

实验在OpenFly基准上进行,DreamFly在测试可见与不可见分割上分别达到32.04%/29.46%的SR和28.22%/23.54%的SPL,两项指标均优于所有对比方法,并取得最低导航误差。结果表明,联合建模历史上下文、未来动作结构与显式终止对空中VLN任务有效。


这项工作为空中VLN提供了完整的技术方案,其因果记忆与滚动规划思路也可迁移至其他具身导航场景,对长时程决策任务具有参考价值。

#AI论文 #机器学习 #DreamFly #VLN #扩散模型 #具身智能 #导航
@AIPaperCN



20 last posts shown.