多模态视频大模型」共找到 8238 篇相关文章

新闻资讯7

7B小模型超越DeepSeek-R1:模仿人类教师,弱模型也能教出强推理LLM | Transformer作者团队

Transformer作者之一创立的Sakana AI带来新方法,让教师模型像人类教师一样做启发式教学,根据已知解决方案输出解释。用此方法训练的7B小模型在传授推理技能上比671B的DeepSeek - R1更有效。

量子位
开源动态7

MIDAS:快手可灵发布实时交互式数字人生成框架

近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。

带你学AI
开源动态8

超低延迟的端到端语音模型!首次生成音频仅需53ms,比同级别模型快3-5倍!

随着语音应用场景普及,语音大模型响应慢成瓶颈。VITA团队开源端到端语音模型VITA - Audio,7B参数模型首次生成音频仅53毫秒,比同级别快3 - 5倍,完全开源,有超低延迟等优势。

开源星探
新闻资讯7

刚刚,Meta 发布新模型,股价大涨 10%

Meta发布新模型Muse Spark,是原生多模态推理模型,支持多种功能。其沉思模式处理复杂问题表现佳,还有新购物模式。虽评论区有质疑,但Meta股价大涨。模型未开放API等,实际实力待察。

AGI Hunt
新闻资讯8

Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!

时隔5个月,xAI发布通用模型Grok 4,后续还将推编码、多模态代理和视频生成模型。Grok 4已上线,有三个订阅版本。马斯克称其智能超博士生,在多基准测试中领先,编码或超Cursor。

InfoQ
算法论文8

EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!

近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。

深度学习自然语言处理
新闻资讯8

火山引擎发布豆包大模型1.6,加速Agent大规模应用

6月11日,火山引擎举办Force原动力大会,发布豆包大模型1.6、视频生成模型Seedance 1.0 pro等,升级Agent开发平台。豆包1.6表现优异,应用广泛;Seedance 1.0 pro评测领先。还通过创新定价等推动Agent规模化应用。

AIGC开放社区
新闻资讯7

忘掉大模型,微软实证:小模型才是Agentic AI的未来!

过去两年大模型在数学竞赛题上靠Test - Time Scaling发展遇天花板。微软rStar2 - Agent让14B小模型学会‘写代码→跑结果→改思路’,表现出色。还介绍了其基础设施、算法、训练配方等方法。

PaperAgent
产品应用8

每一幕皆可控!字节发布多主体视频生成神器,人人皆主角

字节发布多主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,多人同台也不串脸。它采用三阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务。

量子位
开源动态8

世界模型评测的最大盲区,被这个新基准捅破了

过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。

机器之心