「视频推理数据集」共找到 4912 篇相关文章
对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型
InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。
实测惊艳全球的Veo3!音画同步无敌,贵是有原因的
谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。
别再嫌弃MySQL了!AI时代,当DuckDB拥抱MySQL
本文围绕MySQL DuckDB引擎展开,介绍其产品形态演进,如推出只读与主实例。阐述主实例在Binlog适配、高可用与数据安全、数据入库、兼容性等方面能力,还分享出行平台实践,提及未来数据湖集成方向。
Learn to Reason _ The way of Baichuan-M1-ClinicReasoning
前百川智能研究小组负责人阎栋分享大语言模型临床推理。回顾推理技术发展,以Deepseek为例;介绍百川在医疗推理实践,模型达三甲主治水平;还谈及大模型训练困境及与人类智能差异。
「AI重大飞跃」OpenAI官宣:内部实验模型在IMO 2025中取得金牌,GPT-5即将发布
OpenAI研究员Alexander Wei宣布团队开发的内部推理模型在IMO 2025中获相当于人类金牌成绩,还透露GPT - 5即将发布。模型按人类规则评估,解决5个问题,代表AI通用推理能力飞跃,成果不局限于数学推理。
Seedance 2.0,凭什么刷屏?
2026年2月7日,字节跳动旗下AI视频生成大模型Seedance 2.0开启内测后刷屏。它解决AI视频可用率低、成本高的痛点,引发资本市场关注,虽面临挑战,但也让AI视频成可用生产力工具。
断崖第一!深度机智Z-WM再夺WorldArena冠军
2026年5月深度机智成立一周年,其Z - WM在WorldArena Track 2夺冠,领先30.5分。该公司围绕人类第一视角数据构建完整技术体系,其成果表明生成数据可用于具身智能模型训练,具身智能竞争重心正迁移。
科幻!谷歌放出Gemini Robotics-ER 1.5:机器人有了真正的思考力
谷歌推出首个广泛开放给开发者的机器人具身推理模型Gemini Robotics - ER 1.5,可作为机器人高级推理大脑。它能解决物理问题,有新能力如快速空间推理等,还能让开发者平衡延迟与准确性。
昨天夸国产大模型争气,今天Vidu Q3就霸榜了
国产视频大模型Vidu Q3在国际权威AI基准测试机构Artificial Analysis的最新榜单里,于Video Arena冲到全球第二、国产第一。它是全球首个支持16秒音视频直出模型,声画同出、高清直出,还有镜头控制、多语言文字渲染等优势。
社区供稿丨揭秘端到端文档OCR模型 POINTS-Reader
腾讯开源端到端文档OCR模型POINTS-Reader,论文被EMNLP 2025主会录取。它提出可扩展数据生成方案,具简洁、性能好、高吞吐量等特点,通过两阶段训练方案解决依赖蒸馏数据问题,在多基准测试表现佳。