「视频预训练模型」共找到 8436 篇相关文章
4倍速吊打Cursor新模型!英伟达数千GB200堆出的SWE-1.5,圆了Devin的梦!实测被曝性能“滑铁卢”?
Cognition推出全新AI编码模型SWE-1.5,专为软件工程任务设计,运行速度快,在基准测试中成绩良好。它基于GB200芯片训练,有定制编码环境,开发有新战略,还与Cursor新模型Composer对比引发关注。
NeurIPS 2025 | 中科大、港中深、通义千问联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%
大型推理模型在精确数学计算上存在问题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千问联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。
腾讯混元挖走微软明星大模型团队!一作全员出走,新成果已跻身大模型竞技场TOP 10
微软明星大模型WizardLM一作全员加入腾讯混元,最新成果Hunyuan - Turbos跻身大模型竞技场TOP 10。此前WizardLM - 2发布不顺,且微软将裁员超6000人,国内大厂正激烈争夺大模型人才。
超低延迟的端到端语音模型!首次生成音频仅需53ms,比同级别模型快3-5倍!
随着语音应用场景普及,语音大模型响应慢成瓶颈。VITA团队开源端到端语音模型VITA - Audio,7B参数模型首次生成音频仅53毫秒,比同级别快3 - 5倍,完全开源,有超低延迟等优势。
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
SimpleTIR:让大模型“边写代码边思考”不再崩溃
SimpleTIR可解决多轮工具调用中训练崩溃问题。作者指出崩溃原因是分布偏移、低概率token链式雪崩和梯度爆炸。它采用void turn过滤,掐断崩溃链路,训练稳定,还催生多样推理行为,且工程友好已开源。
火山引擎发布豆包大模型1.6,加速Agent大规模应用
6月11日,火山引擎举办Force原动力大会,发布豆包大模型1.6、视频生成模型Seedance 1.0 pro等,升级Agent开发平台。豆包1.6表现优异,应用广泛;Seedance 1.0 pro评测领先。还通过创新定价等推动Agent规模化应用。
美团智能体SOTA模型LongCat-Flash-Thinking-2601开源
美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。
GPT-5都救不了的AI幻觉,原来问题不在模型,在“考卷”
OpenAI研究指出AI产生幻觉的根本原因是评估和激励机制有问题。现有训练和评估流程奖励‘猜测’,导致模型易产生幻觉。研究还给出解决方案,要更新‘考试规则’,让模型适当表达不确定。
复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」
多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。