「视频推理数据集」共找到 4900 篇相关文章
“无限可能”AI视频竞演第二阶段结果揭晓,11部作品入围深圳路演大会
3月8日,“无限可能”AI视频竞演完成二阶段评审,11部作品从50部入围作品中选出,晋级3月14日深圳路演大会。作品经“幻镜”AI视听测评季第三季测评,结果将现场公布。
Gemini CLI 重磅更新:现已支持音视频处理,并带来多项体验升级
Gemini CLI 迎来重磅更新,带来多项改进。新增音视频输入(暂未正式开启)、增强 Markdown 功能,集成 VSCodium 和 Neovim,技术栈升级至 Ink 6 和 React 19,还有主题更新、隐私管理等优化。
逆势降本:云上数据平台年复削减30%的治理实践
本文是朴朴科技对云上大数据平台成本治理的阶段性总结。其开展成本治理已三年,分“降本增效”三部曲:成本发现与分析、成本优化与控制、体系化治理构建,分享经验,助力同行开展相关工作。
不止于快!美团新推理模型正在重新定义「实用主义AI」
美团发布并开源推理模型 LongCat-Flash-Thinking,它在权威测评表现突出。该模型有多项创新,能更快、更能干、更可靠。其将技术实力转化为业务服务能力,实战测试表现佳,体现美团实用主义 AI 路径。
告别无效计算!新TTS框架拯救19%被埋没答案,推理准确率飙升
现有TTS方法存在路径同质化和中间结果利用不足问题。华为诺亚方舟实验室等机构提出SRCA框架,含检查点注入、答案聚类搜索和检查点候选增强组件,实验显示能提升推理准确性、效率,降低成本。
国产开源新突破!5万小时真机数据,撕开行业最大痛点
蚂蚁灵波开源具身操作基座模型LingBot-VLA 2.0,用同一套模型「驯服」20种机器人构型。它覆盖5万小时真机数据,在通用泛化能力上全面升级,还带来三大底层技术革命,可降低重复适配成本。
物理-数据双驱动的大迎角非定常气动力建模 | 航空学报CJA
现代飞行器大迎角机动时,气动力复杂,现有建模方法面临两难。论文提出DEM - LSTM混合框架,结合专家经验与数据驱动,解决小样本、强非线性挑战,经算例验证性能优势明显。
人大高瓴赵鑫团队新作:先拆掉 RLVR,再重建推理模型训练
人大高瓴赵鑫团队围绕RLVR框架做系统实验,完成论文《A3PO: Adaptive Asymmetric Advantage Shaping for Reasoning Models》,提出A3PO方法。该方法将训练重点转向关键决策点,让推理模型学习更可控。
长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍
牛津大学团队提出VMem,把「看过什么」写进几何小片,用基于3D几何的记忆索引替代短窗上下文,实现「一致性更强、资源更省、速度更快」,实测速度比常规管线快约12倍。
刚刚,OpenAI内部推理模型斩获IOI 2025金牌!所有AI选手中第一
OpenAI内部推理模型获IOI 2025金牌,总排名第6、AI组第1,沿用IMO金牌版本且未专门训练。商业模型在IOI表现不足,Grok 4相对领先。巨头热衷竞赛,源于竞争、技术迭代及多方利益考量。