「视觉 - 语言模型」共找到 8010 篇相关文章
Meta 新成立超级智能实验室,让大模型RAG推理速度飙升30倍
Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为大模型部署提供实用方案。
开源端到端语音大模型:直接从原始音频输入,生成语音输出
目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。
征集全国首部AI大模型私有化部署标准起草单位和个人!
智合标准中心组织起草国内首部AI大模型私有化部署标准《人工智能大模型私有化部署技术实施与评价指南》,已正式立项并征集起草单位和个人。该标准能解决企业部署痛点,有全流程覆盖等亮点。
高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线
现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。
AI根本守不住秘密!不依靠大模型的输出过滤才是铜墙铁壁
开发者常把秘密放系统提示词,以为安全。Swept AI和密西根大学团队测试发现,攻击者不断尝试,AI会泄露秘密。多种依赖大模型的防御方案失败,只有输出过滤能零泄露。
732M模型超越7B!机器人操控新范式:从视频中「悟」物理
机器人操控有「数据困境」,传统方法需大量人工标注动作演示数据。中山大学王广润教授团队从视频生成模型「借」物理直觉,提出PAR和PhysGen,与英伟达DreamDojo核心思路一致,验证了新的技术路线。
嚯!国产视频模型的物理水准超神了 | 实测MiniMax海螺02
MiniMax上新视频生成模型Hailuo 02,解决了AI视频生成中体操难题。该模型原生支持1080p,能处理极端复杂物理场景,实测文生、图生视频能力出色,成本创新低,MiniMax本周还有多项技术布局。
ICML'25 | 告别手动SFT!一句话得到你的专属大模型LoRA
传统微调方法开销大、部署难,Text-to-LoRA (T2L) 框架应运而生。它基于自然语言指令对 Transformer 模型即时适配,有三种架构变体,采用两种训练方法,实验显示其在多维度表现有效。
不止于快!美团新推理模型正在重新定义「实用主义AI」
美团发布并开源推理模型 LongCat-Flash-Thinking,它在权威测评表现突出。该模型有多项创新,能更快、更能干、更可靠。其将技术实力转化为业务服务能力,实战测试表现佳,体现美团实用主义 AI 路径。
AI 大牛刘威创业公司完成 5000 万美元融资,12 月将发布新模型
当地时间11月5日,刘威创立的Video Rebirth完成5000万美元种子轮融资,用于打造视频生成模型。公司计划12月发布Bach模型及AI视频生成平台,将与OpenAI Sora竞争,虽对手强大,但刘威认为小团队有机会。