类R1训练」共找到 2516 篇相关文章

算法论文8

模型合体!上交&上海AI Lab&华师提出LED-Merging,拒绝「能力」与「安全」二选一

上海人工智能实验室等团队提出LED - Merging解决模型融合“安全 - 效用冲突”问题。该方法无需训练,像“神经元手术刀”,不牺牲专业能力还提升安全性,论文已被ACL 2025 Main Conference接收。

深度学习自然语言处理
算法论文7

The Batch:826 | 提高输出准确性的记忆层

通常提高大语言模型事实准确性需更大模型规模,会增加计算成本。Meta研究人员在transformer架构加可训练记忆层,可高效存储提取信息,提升计算效率,测试显示其能提升模型输出质量。

DeeplearningAI
算法论文8

拒绝「盲修」:JarvisEvo 如何让 Agent 像人一样拥有「视觉反思」能力?

现有 Image Editing Agent 缺乏视觉反馈,易致「指令幻觉」和 Reward Hacking。JarvisEvo 应运而生,它通过 iMCoT、SEPO、On - Policy Reflection 等技术,结合 ArtEdit 数据集和三阶段训练,在修图上表现出色,意义超图像编辑。

机器之心
算法论文8

首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会

香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。

机器之心
新闻资讯8

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

OpenAI正式发布GPT - 6 Astra和GPT - 6 Astra Pro,宣布AGI时代开幕。该模型训练规模大,能力升级显著,价格公布。基准测试成绩优异,在多方面表现突出,还展示诸多实际应用案例,已有企业开始测试。

量子位
开源动态8

DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude

DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。

AIGC开放社区
新闻资讯7

《时代》2025重塑世界的五大AI进展

本文讲述2025年AI重大进展。中国Deepseek R1开源模型冲击全球格局,AI具备思考能力,特朗普政府推“星际之门计划”,AI公司支出逼近1万亿美元,同时AI与人关系更复杂,引发风险思考。

AIGC开放社区
算法论文8

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS'25

卫星星座成数字经济时代基础设施,但运行背后规划难题待解。北航刘偲教授团队提出首个大规模真实星座调度基准AEOS - Bench,训练内嵌时间约束的调度模型AEOS - Former,为‘AI星座规划’奠定新技术基准。

量子位
开源动态7

DeepSeek悄悄开源LPLB:用线性规划解决MoE负载不均

昨天,DeepSeek 在 GitHub 上线新代码库 LPLB 解决 MoE 负载不均。它利用线性规划算法优化专家并行工作负载分配,能处理动态波动,但也存在忽略非线性成本等局限,对 MoE 架构训练加速有参考价值。

机器之心
产品应用7

打破幻觉!Qwen最新OCR让印章、表格、公式识别准确率飙升45%

基于推理增强框架的视觉语言模型处理OCR任务有成果,但存在生成幻觉问题,特定领域不如专家模型。DianJin - OCR - R1通过推理与工具交互,按‘思考 - 调用工具 - 重新思考’流程提升OCR性能,减少幻觉。

CourseAI