视频推理」共找到 2907 篇相关文章

产品应用8

刚刚,国产视频模型登顶全球第一!给谷歌Veo上了一课,还把钱给挣了

国产视频生成模型SkyReels V4在第三方榜单中登顶全球第一,压过谷歌Veo 3.1等。它能力强大,解决视频AI老毛病,支撑昆仑万维短剧平台DramaWave,构建了完整AI生态闭环。

新智元
算法论文8

从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现大模型高效沉默推理

复旦大学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让大模型高效沉默推理

AIGC开放社区
产品应用7

Medeo 教程:一次生成无脑抽卡不可取,真正的视频 Agent 应该啥样

本文介绍AI视频生成Agent Medeo 1.0版本,它支持短或超长提示词,泛化性好,多种垂类视频都能做。文中介绍其基础操作、展示案例和提示词,还剖析了能兼顾质量与灵活度的原因,目前产品在内测将全量上线。

歸藏的AI工具箱
算法论文8

不改模型也能提升推理性能?ICLR投稿提出测试时扩展新范式OTV

ICLR 2026投稿论文提出单token验证(OTV),是测试时扩展新机制,让模型能边推理边判断正误。它基于并行思考思路,借助轻量内部验证器分析推理过程,实验显示其性能优于主流方法。

量子位
开源动态7

强迫模型自我争论,递归思考版CoT热度飙升!网友:这不就是大多数推理模型的套路吗?

近日,概念CoRT火了,它在CoT基础上加了“递归思考”,能让AI递归思考响应、生成替代方案并选最优,结合“结构化自我批判”提升推理力。不过网友质疑它是“新瓶装旧酒”。

机器之心
开源动态7

ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频

空间音频技术成提升沉浸式体验关键,但现有技术未充分利用360°全景视频空间信息。OmniAudio研究可直接从360°视频生成空间音频,相关代码和数据集已开源,虽有局限但前景好。

量子位
推荐文章7

2025.7.4上午 | 视觉智能驱动的多模态对齐与推理的近期系列工作分享 - 复旦博士生王思尹

本次分享由复旦博士生王思尹围绕‘视觉智能驱动的多模态对齐与推理’展开,介绍多模态大模型探索研究,涉及跨模态组合语义理解、视觉参与推理及基于视觉建模世界完成行动等内容。

深度学习自然语言处理
产品应用8

AI真有希望考清北了!豆包1.6多模态推理发威,闯关数理化带图大题

火山引擎原动力大会发布豆包大模型1.6,它是国内首款多模态SOTA模型,支持256k上下文长度。实测中它解答高考数理化带图大题表现出色,还具备图像识别、视频理解、GUI操作等能力。此外,火山引擎还推出系列工具和平台助力企业。

新智元
算法论文8

NeurIPS25高分论文|以判别式监督学习强化推理LLM,解决难度偏差和熵崩塌难题

德州农工大学博士生李港在NeurIPS25高分论文中,分析GRPO优化目标,发现难度偏差局限及与判别式监督学习联系,提出DisCO框架强化大型推理模型,其优势显著,实验表现优于GRPO及其变体。

机器之心
算法论文8

一句话生成无限逼真3D场景!匹兹堡大学新作直击VLM空间推理软肋丨CVPR'26

VLM在3D空间推理上表现不佳,且缺乏合适测试基准。匹兹堡大学团队提出InfiniBench框架,用LLM Agent迭代优化和聚类策略,可按需生成3D场景,还能精准定位大模型空间推理缺陷。

量子位