「视频推理数据集」共找到 4930 篇相关文章
对话AutoCoder宿文:做5000万程序员的AI IDE,不如做10亿软件消费者的Vibe Coding
2025年AI Coding赛道火热,大厂纷纷布局。AutoCoder创始人宿文认为不应与大厂卷辅助编程,要走出差异化,做面向10亿软件消费者的Vibe Coding。团队迭代代码模型,产品数据表现佳,还分享了创业、产品、市场等多方面看法。
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。
小扎「芒果」生图只输GPT Image 2,没人教它改稿,它自己学会了
Meta推出图像生成模型Muse Image(代号「芒果」)和视频模型Muse Video预览版。Muse Image在文生图榜单排第二,改变画图方式,能自我修正。它与Muse Spark打通,Muse Video文生视频排第3。不过,其@功能有隐私隐患。
Ψ₀刚刚开源了!迈向通用人形机器人的基座模型
南加州大学团队开源迈向通用人形机器人的基座模型Ψ₀,仅需80条真机遥操作数据,在总体任务成功率和子任务指标上平均领先NVIDIA最新开源模型GR00T N1.6超40%,还介绍了其数据、训练、架构等方面。
马斯克还在卷10秒,中国AI直接掀桌!16秒一镜到底,全球唯二
2026年AI视频圈竞争激烈,硅谷巨头激战正酣,马斯克Grok Imagine上线生成10s视频功能。在此背景下,中国AI的Vidu Q3登场,16s音画直出一镜到底,还支持多种功能,位列中国第一、全球第二。
给 Happy Horse-1.0 讲完戏,我无痛当上导演了
文章聚焦阿里新发布的视频模型Happy Horse-1.0,经测试它在多镜头一致性、人物表现力和视频编辑功能上表现出色,能产出电影质感画面,且价格有竞争力,但物理拟真短板明显,已具影视工业应用潜力。
企业落地 NL2SQL,需要的是 AI-ready data 和 小模型
当NL2SQL从Demo走向生产,关键是‘更干净的数据底座 + 更小的专用模型 + 更可控的工程化流程’。文章指出先数据后模型,小模型足够用且落地成本低,评估要换维度,还介绍了工程化路径等内容。
走访100+机器人展台:拐点已至,具身智能进入千行百业|WAIC 2026
7月17日,2026世界人工智能大会在上海开幕。与往届不同,今年大会更多展示具身智能在真实场景的应用。硬件迭代、软件与数据突破,让泛化能力和任务执行成功率显著加强。现场还呈现模型四条技术路线、数据基建等趋势。
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知
视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对长时序或精细操作任务时性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。