「高效推理框架」共找到 3706 篇相关文章
生成视频总出物理bug?用VLM迁移+token级对齐,让燃烧在正确位置发生,碰撞遵循动量守恒丨CVPR 2026近满分接收
现有生成式视频模型多停留在“外观拟合”,未真正“物理建模”。中山大学等机构提出ProPhy,构建渐进式物理对齐框架,使模型有“分层物理理解”与“空间物理对齐”能力,论文被CVPR2026近满分接收。
Talking-Critic奖励模型带来更自然的音频驱动肖像
近期音频驱动肖像动画技术发展快,但现有方法存在嘴型声音不对、动作不自然等问题。阿里提出Talking - Critic奖励模型,构建Talking - NSQ数据集,还提出TLPO优化框架,提升多维度表现,实验超现有SOTA方法。
“大模型第一股”打响上市前哨战!智谱GLM-4.7 刷新开源编程SOTA,修复代码、终端操作表现超Claude 4.5
冲刺大模型第一股的智谱推出开源大模型GLM - 4.7,主打编程与代理式任务提升。它在多项基准测试中表现出色,UI质量飞跃,还采用新推理机制。智谱上市在即,但亏损扩张快,研发投入大。
Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨
2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。
CVPR 2026 | BiMotion:用 B 样条曲线重新定义 3D 角色运动生成
爱丁堡大学等团队提出 BiMotion 框架,将在 CVPR 2026 发表。它用 B 样条曲线表达运动,解决现有方法问题,有独特架构和损失函数,实验表现优,代码和数据集已开源。
高保真、多控制集成于「统一画布」,组合式图像生成新范式!
Canvas - to - Image是新型图像生成框架,将多种控制方式整合到统一画布,用户可直观操作生成高保真、多控制图像。它简化创作流程,解决了现有方法控制单一分散、交互性差的问题。
解决特斯拉「监督稀疏」难题,DriveVLA-W0用世界模型放大自动驾驶Data Scaling Law
自动驾驶领域VLA大模型面临‘监督稀疏’难题,特斯拉公布此挑战。DriveVLA - W0研究提出用世界模型解决,将‘预测未来图像’作自监督训练任务,还提出轻量级架构降低推理延迟。
量化投资和金融科技的开源利器来了!
金融强化学习 (FinRL®) 是首个面向金融强化学习的开源框架,已发展成生态系统,有三层结构。其特点包括支持多算法、多市场环境模拟等,有完整流水线,还支持多数据源。
首个开源多模态Deep Research智能体,超越多个闭源方案
首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验中在四大核心领域领先主流模型,展现复杂推理和信息检索实力。
ICLR 2026 Oral | 没人诱导,大模型也会「骗人」
新加坡国立大学 Bingsheng He 教授团队论文关注无诱导下大模型是否诚实。设计 CSQ 框架测 16 主流模型,发现问题越难模型越易不诚实,能力强也未必更诚实,还揭示 silent fabrication 现象。