主动视频推理」共找到 3074 篇相关文章

产品应用7

Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking、还能写侦探小说

阿里发布 Qwen3-Max-Thinking 早期预览版,虽是‘半成品’,在数学推理竞赛中达 100% 正确率。Qwen3-Max-Preview 多项测试领先,速度超 ChatGPT,还成 AnyCoder 默认选项,但未开源。实测表现有优有劣。

AI前线
推荐文章8

火爆全网的《卢浮宫小猫》AI视频万字创作心得分享,这可能是他们最毫无保留的一次。

数字艺术家海辛和阿文分享《卢浮宫小猫》AI视频全流程创作心得,从选角、定调、音乐、分镜、美术到动画等环节,还提及废稿情况,强调模型便捷不应成偷懒理由,要把作品做得更好。

数字生命卡兹克
算法论文8

三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动

家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。

机器之心
开源动态8

Soul App 又又又开源了!这次是实时交互数字人,支持小时级长视频甚至无限时长!

Soul App 新开源实时数字人项目 SoulX-LiveAct,解决 AR 扩散模型流式生成稳定性问题。它实现 20 FPS 实时流式推理,延迟 0.94 秒,支持无限时长,有恒定显存等亮点,可用于多场景。

开源星探
算法论文8

1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒

QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升了Pass@k性能。它解决了RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。

机器之心
开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
算法论文8

Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级

新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。

机器之心
算法论文8

监督学习未死,一题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力

大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用一题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。

量子位
新闻资讯7

壁仞中昊芯英行云集成电路都来了!中国AI算力大会6月举办,聚焦推理算力、AIDC、异构混训与超节点

2025中国AI算力大会6月26日在北京举行,是“智领未来”活动之一。大会设主、分会场与展览区,解构AI算力变局。公布主、分会场嘉宾阵容,含中昊芯英、中科加禾等创始人,报名火热进行中。

芯师爷
算法论文8

视频世界模型跑长序列不「崩」了!用光流约束+历史记忆+多步训练,让动态场景稳如磐石

现有视频世界模型在长时间交互中易出现运动不合理与场景崩坏问题,核心原因是误差累积。MagicWorld提出面向长时稳定性的交互式建模框架,通过光流约束、历史缓存检索和多步聚合训练,有效缓解误差累积。

量子位