「RCT实验」共找到 1300 篇相关文章
NeurIPS 2025 | ARGRE框架实现高效LLM解毒:自回归奖励引导,安全对齐更快、更准、更轻
北航等机构研究提出自回归奖励引导表征编辑(ARGRE)框架,在LLM潜在表征空间可视化毒性变化路径,实现测试阶段高效“解毒”。实验显示其降低毒性、缩短推理时间,不影响模型能力,优于基线方法。
AI当员工,24小时不休息,17天干完人类数年活!
劳伦斯伯克利国家实验室正将人工智能、自动化技术和数据系统融入科研,构建“人机共生”科研生态。像A - Lab、Autobot等工具发挥重要作用,AI还让大科学装置更智能,实现实时决策,开创“AI设计,实验验证”模式。
三星研究院发布手机端侧大模型MeKi:基于Memory的LLM扩展新范式,支持旗舰手机端侧部署
三星研究院发布端侧大模型架构MeKi,提出用存储空间扩展模型容量、提升LLM性能的新范式。它利用手机ROM缓解内存压力,实现容量与性能提升。实验显示其性能、效率表现优,为边缘部署LLM提供新思路。
奖励模型预训练新范式POLAR:突破强化学习短板,有望打通RL链路扩展“最后一环”
强化学习中奖励模型设计与训练是瓶颈,上海人工智能实验室提出奖励建模新范式POLAR。它摆脱传统“绝对偏好”限制,契合强化微调框架,通过对比学习训练,实验证明其性能和泛化性佳,有望打通RL链路扩展最后一环。
微软×UIUC:给每个学生造一个「数字分身」,AI教师终于有了陪练
微软和 UIUC 合作研究 StudentSim,基于真实学生数据训练个性化学生模拟器框架,解决了过去学生建模方法的问题。它经两阶段训练,在多领域实验中表现出色,还能为 AI 教师优化提供反馈。
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
全球排名前三,复旦自进化Harness Engineering让GPT‑5.4再涨7个点
2026 年以来,Harness Engineering 成业界热词。复旦大学等团队提出 Agentic Harness Engineering (AHE),可实现 Harness 自动优化。实验中,AHE 让 GPT - 5.4 分数提升,适配 GPT - 5.5 后排名全球第三,且有良好泛化能力。
迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准
中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。
IROS 2025 | 机器人衣物折叠新范式,NUS邵林团队用MetaFold解耦轨迹与动作
新加坡国立大学邵林团队提出MetaFold框架用于机器人衣物折叠。它创新分层架构,解耦任务规划与动作预测。构建开源数据集,经实验在多指标超现有方法,还验证了从仿真到现实的迁移能力。
大模型自信心崩塌!谷歌DeepMind证实:反对意见让GPT-4o轻易放弃正确答案
谷歌DeepMind携手伦敦大学研究发现,GPT - 4o、Gemma 3等大语言模型有“固执己见”和“被质疑就动摇”并存的冲突行为,原因与训练、决策逻辑、记忆机制有关。研究还通过两轮实验证实。