视频推理」共找到 2915 篇相关文章

开源动态8

告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式

传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。

机器之心
产品应用8

数学奥赛高分摘金,位列大模型榜首,『书生』科学多模态大模型Intern-S1能力再升级 | 通专融合新进展

2025年CMO决赛首设AI测试,书生科学多模态大模型Intern-S1以102分位列大模型得分榜首,远超金牌线和国家集训队入选线。其推理能力提升得益于多项创新,未来将拓展至多领域科研。

OpenMMLab
算法论文8

ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」

文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。

机器之心
算法论文8

GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”

多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。

深度学习自然语言处理
开源动态8

国产双开源:让Mac成为你的私人AI工作站

2026年3月底,Ollama将Mac版底层推理引擎换为苹果MLX框架,性能提升显著。明略科技开源Cider和Mano - P,Cider加速推理,Mano - P可操作图形界面,两者结合推动Private AI发展。

机器之心
产品应用7

震撼好莱坞,一天AI生成10部短片,Google神器比肩一个影视工作室

Google的AI视频神器Veo 3刷屏,使用门槛低,生成效率高,效果震撼。它能生成二次元、科幻、仙侠等多种类型短片,虽有不足,但极大促进AI视频发展,适合多行业基层人员。

鲸选AI
新闻资讯8

黄仁勋CES2026最新演讲:三个关键话题,一台“芯片怪兽”

北京时间1月6日,英伟达CEO黄仁勋在CES2026演讲。回顾过去一年开源模型发展,本次围绕系统与基础设施、模型、应用落地三条主线演讲,展示Rubin架构等成果,推动推理型AI发展及应用。

芯师爷
新闻资讯8

首次,AI下棋不再是「黑盒」!

上海AI Lab发布升级版大模型「书生·思客InternThinker」,首度打破围棋AI推理黑盒,能用自然语言解释落子逻辑,具备职业3 - 5段棋力。依托创新训练平台InternBootcamp,它在多任务表现出色,且相关技术有系列创新突破。

新智元
产品应用8

腾讯发布Hunyuan-GameCraft!从静图进入动态游戏世界

近年来,现有方法难满足游戏视频生成需求。腾讯推出Hunyuan - GameCraft,可基于一张图像和提示词生成游戏交互视频,能精准响应交互信号,保留历史场景信息,不过动作空间待丰富。

带你学AI
算法论文8

Loop-ViT:让AI学会「反复思考」,3.8M参数小模型追平人类平均水平

香港科技大学等团队提出 Loop - ViT,将循环 Transformer 引入视觉推理领域。该模型参数少但性能强,3.8M 小版本追平人类平均水平,揭示视觉推理任务中‘思考时间’比‘模型大小’更重要。

机器之心