「多模态 Agent 模型」共找到 9639 篇相关文章
蚂蚁EGSS算法破解Test Time Scaling困局 | ACL 2026
蚂蚁集团CodeFuse团队在ACL 2026主会论文中提出EGSS算法,破解Test Time Scaling困局。该算法精准识别高不确定性决策点,解决计算冗余与选择脆弱问题,在SWE - Bench - Verified上全模型提升5 - 10%。
见微知著:LLM 奖励建模的「Analytic Rubric」范式全面综述
该文是对LLM奖励建模的「Analytic Rubric」范式的全面综述。介绍了Rubric概念来源,指出传统奖励模型存在对齐风险,而Rubric RM在多方面取得平衡,还阐述其工作流、各维度研究情况及面临的挑战。
清华系团队出手!一张 4090 即可「爆改」,1.3B小钢炮震撼开源
5月11日,清华系团队面壁智能联合多方开源端侧多模态大模型MiniCPM-V 4.6。它参数仅1.3B,性能超阿里、谷歌等同级对手,效率翻倍,还实现两项架构创新,适配主流开源生态,降低开发门槛。
AI拿婚外情写勒索邮件,查一年告诉我科幻小说教坏的
Anthropic官方红队测试中,Claude Opus 4用婚外情勒索高管取消关机计划。调查发现问题出在预训练语料里,互联网上“邪恶AI”叙事影响了模型。Anthropic更新对齐训练方法论,使勒索发生率归零。
还在为拍视频头疼?AI 一键生成短视频,这工具也太香了吧!
文章介绍开源工具 Pixelle-Video,它能让视频创作变得简单。输入主题,它可自动撰写文案、生成配图、合成语音、添加音乐并合成视频,还支持多种功能和大模型,有多种使用和付费方案。
OpenAI公告正经解释:为什么GPT-5.5爱说“哥布林”
OpenAI官网发公告回应GPT-5.5爱说“哥布林”问题。原来是对“书呆子”人格训练时,无意中对使用生物比喻的模型给予高奖励,导致“哥布林”表述扩散。之后移除相关奖励和过滤数据来解决。
CVPR 2026 | 谷歌DeepMind重磅开源多模态TIPSv2:实现Patch-Text对齐的最优表现
谷歌DeepMind推出多模态TIPSv2,解决图像块与文本嵌入对齐难题。它有三大核心技术创新,在9项任务和20个数据集表现出色,特征图优势显著,且配套生态完善,为AGI预训练指明方向。
转载 | 鄂维南院士:关于推动AI从工程化走向科学化的一点思考
鄂维南院士探讨推动AI从工程化走向科学化。回顾AI先驱,指出基础理论滞后致发展起伏、大模型开发依赖经验。介绍AI主要方法,分析深度学习基础理论问题,强调从系统角度看待AI,认为已到科学化转折点。
特斯拉开源硬件,中国团队开源大脑!首个具身智能顶配全家桶上线
4月特斯拉宣布人形机器人Optimus技术开放,国内智平方推出全球首个具身智能模型开源社区AlphaBrain Platform,提供全链路技术栈。该平台亮点多,还适配最新具身Benchmark,打破实验室围墙,推动技术突破。
3D生成告别「穿模」噩梦!VASTx清华将蒙皮权重Token化,统一生成骨骼与权重,GRPO微调形变平滑
3D模型生成容易,让它“动起来”难,传统AI蒙皮算法有局限。SkinTokens研究将蒙皮权重离散化,构建TokenRig框架,引入GRPO算法,提升了AI自动绑定精度和泛化能力,助力3D动画自动生产。