「音频语言模型」共找到 8068 篇相关文章
谷歌Gemini 2.5全线爆发!勇战「濒死恐慌」,却被丝血宝可梦吓到当场宕机
谷歌旗舰Gemini 2.5全家桶三款模型昨夜上线,包括正式版2.5 Pro、2.5 Flash及预览版2.5 Flash - Lite。技术报告显示其性能提升显著,还在玩宝可梦时惊现类人恐慌,推理性能下降。
想进OpenAI?先解出这道题,百万美元算力已就位
OpenAI发起Model Craft Challenge「Parameter Golf」项目,要求在固定数据集上降验证损失,模型产物控制在16MB内,8张H100 GPU 10分钟完成训练。提供百万美元算力,6月招早期人才,挑战3月18日至4月30日。
AI读不懂文档结构?计算所重构Agentic RAG文档推理能力
大语言模型工具使用能力推动RAG进化,现有Agentic Search框架有“结构盲”问题。中科院计算所团队提出DeepRead,将文档结构转化为坐标系统,用两大工具协同实现类人推理,在多数据集验证效果显著。
智能流体力学青年学者论坛第30讲~33讲
智能流体力学青年学者论坛第30 - 33讲将于2026年3月6日举办,由中国空气动力学会智能流体力学专委会主办。报告涵盖迈向大语言模型时代的自动化智能CFD工作流等主题,多位学者将分享最新研究成果。
安卓党狂喜!Open-AutoGLM让手机自己订外卖、抢票、刷小红书
Open - AutoGLM是能让手机自己干活的黑科技,给手机装了「AI打工人」。它整合视觉语言模型与ADB远程操控技术,适配50 + 款主流应用,自带安全边界,普通人易安装,开发者可自定义流程。
Karpathy:别再问AI「你怎么看了」,这是错误的提示词策略!
Andrej Karpathy提出不要把大语言模型看作实体,应视作模拟器。他建议探索话题时避免用‘你怎么看’提问,给出‘什么样的一群人适合探索,他们会怎么说’的更优策略,还指出不同领域影响有别。
3A大作!阿里ROLL团队从基建->算法->机理,推动RL4LLM全栈协同优化
阿里巴巴ROLL团队联合高校推出「3A」协同优化框架,推动「强化学习用于大语言模型(RL4LLM)」迈向新范式。Async架构提升GPU利用率,AsyPPO降低计算资源消耗,Attention机制提升训练效率与可解释性。
“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%
多模态长文档视觉问答常见于科研论文等场景,现有技术路线有大视觉 - 语言模型直接端到端和检索增强生成,但各有缺点。MMRAG - DocQA引入新方案,解决多模态连接和跨页证据链接问题。
超越90%城市规划师!清华、MIT等提出人机协作新范式 | Nature子刊
清华大学联手MIT等机构提出「大语言模型+规划师」新框架,让AI作「智能规划助手」。框架含概念设计、方案生成、效果评估三阶段,实验显示AI表现超九成人类规划师,未来将人机协同。
英伟达推出通用深度研究系统,可接入任何LLM,支持个人定制
英伟达推出通用深度研究(UDR)系统,支持个人定制,可接入任何大语言模型。它能解决现有深度研究智能体的局限性,有诸多创新特性,但目前还在原型阶段,存在一定局限性。