「推理训练数据」共找到 5153 篇相关文章
GPT-5.4发布,AI的最强之争已经结束了!
GPT-5.4发布,作者对比OpenAI、Anthropic、Google三家模型数据发现它们不在同赛道。GPT-5.4适合白领工作,Claude擅编程,Gemini重推理与性价比,且OpenAI因合同问题流失用户。
港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型
香港大学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。
揭示扩散语言模型扩展定律,人大高瓴团队与蚂蚁集团发布LLaDA MoE v2
中国人民大学高瓴人工智能学院与蚂蚁集团合作,首次系统刻画混合专家扩散语言模型扩展定律,据此训练LLaDA MoE v2,实现扩展效率与智能双重突破,将推动其迈向规模化时代。
香港中科院发布聆音大模型,400万张图喂出个“AI超声神医”
中国科学院香港创新研究院发布超声大模型“聆音”,用超400万张图像的超声数据集,经自监督学习训练。它在多项诊断任务破纪录,临床效果佳,还将模型等开源,有望推动领域发展。
一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”
NVIDIA 推出多模态大语言模型 OmniVinci,结合架构创新与数据合成流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发争议。
华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」
IJCAI 2026将召开,AI算力成本高,参数扩张边际收益低,技术创新逻辑转向‘用得更省’。华为四篇被收录论文,用精巧架构和训练策略,在四方向展现系统化工程能力,提供技术转型路径。
让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务
手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。
波士顿动力Atlas人形机器人再现逆天进化:通用AI机器人真的要来了
波士顿动力为Atlas人形机器人训练全新大型行为模型LBMs,它是语言指令驱动的策略模型,能完成复杂操作任务。构建模型有四步骤,实践遵循三大原则,还展示了其多方面操作能力与特点。
突发!Opus 5.1被曝本周发布,最强AI智能体恐大洗牌
消息称Anthropic本周将发布Opus 5.1,其升级聚焦单Token智能水平,强化编程、推理、AI Agent能力;OpenAI 10万亿参数模型Bel完成预训练;企业选模型‘够用就好’,Anthropic Fable 5份额低。
SIGGRAPH Asia 2025|电影级运镜一键克隆!港中文&快手可灵团队发布CamCloneMaster
香港中文大学与快手可灵团队联合提出运镜可控视频生成框架CamCloneMaster,引入‘参考即用’范式,告别对相机参数依赖。其训练、测试代码和数据集均已开源,在各项指标上优于SOTA方法。