生理学实验」共找到 1619 篇相关文章

算法论文8

Loss收敛不代表会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假会”样本

大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是完了。腾讯混元团队发现SFT存在不完全习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。

量子位
算法论文8

告别「利用率崩溃」:GIPO开启大模型强化习高效训练新方法 | ICML 2026

树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及大语言/视觉动作模型强化习训练中,缓解了策略滞后痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。

AI科技大本营
算法论文8

喂给AI的Skill正让它变笨!清华团队发现大模型经验复用的黄金法则

清华大与EvoMap团队研究发现,给大模型提供详尽纠错Skill会使基准测试通过率下跌,而精简控制指令可提升性能。他们提出将程序化Skill转化为策略基因,经实验证实其更适合驱动智能体测试时演化。

AIGC开放社区
算法论文8

NeurIPS 2025|指哪打哪,可控对抗样本生成器来了!

近日,清华大和蚂蚁数科在NeurIPS上联合提出Dual - Flow新型对抗攻击生成框架。它能从海量图像数据“通用扰动规律”,对多模型、多类别发起黑盒攻击,为AI安全带来挑战,已用于蚂蚁数科产品。

机器之心
算法论文8

四足机器人首次同时「思考+走路」,北大提出链式推理MobileVLA-R1

在「大模型+机器人」浪潮中,让机器人既听懂话又走得对、稳很难。北大MobileVLA - R1将链式思考引入四足机器人,在仿真和真实实验中对标强基线实现提升,构建了更具工程可用性的范式。

新智元
算法论文8

碾压π0.5,复旦团队首创「世界模型+具身训练+强化习」闭环框架

复旦团队针对当前 VLA 策略依赖模仿习、真实机器人在线 RL 成本高、传统物理仿真器有局限等问题,提出 ProphRL 框架。该框架以世界模型 Prophet 为核心,结合 RL 算法,为具身智能落地提供更可行路径,实验效果显著。

机器之心
算法论文8

韩松等提出FlashMoBA,比MoBA快7.4倍,序列扩到512K也不会溢出

今年2月月之暗面提出MoBA,在处理长上下文有潜力,但业界缺乏对其性能设计原则的理解和高效GPU实现。来自MIT、NVIDIA的研究者提出FlashMoBA,解决了小块MoBA性能挑战,实验显示其在多方面表现优。

机器之心
算法论文8

智能体新范式Chain-of-Agents,多项任务新SOTA

论文提出Chain-of-Agents (CoA) 范式,结合多智能体系统与工具集成推理优势。通过多智能体蒸馏和智能体强化习训练智能体基础模型(AFM),实验显示其在Web和Code任务上达新SOTA,效率、泛化性佳。

深度学习自然语言处理
算法论文8

Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调

Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用时它能匹敌全量微调。团队系统研究训练集与参数关系,有层选择、习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。

AI工程化
算法论文8

EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法

vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。

机器之心