「音频语言模型」共找到 7946 篇相关文章
印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来
智能驾驶行业激战正酣,千里科技与阶跃星辰合作打造“原生智驾基座模型”。印奇首谈双公司布局,认为中国AI商业闭环要靠车跑出来。千里科技收入、利润双增,智驾装机规模将超百万辆,还布局Robotaxi和超级智能体。
OpenAI、Anthropic、DeepMind联手发文:现有LLM安全防御不堪一击
OpenAI、Anthropic、Google DeepMind 联手发文,研究语言模型安全防御评估。指出现有防御评估有缺陷,提出通用自适应攻击框架,成功绕过 12 种防御机制,多数攻击成功率超 90%。
18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!
网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。
想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下
阿里达摩院推出 RynnBrain 模型,从底层出发将时空记忆和物理空间推理训进模型,在 16 项具身 Benchmark 上达 SOTA。还开源 7 个模型,解决通用大模型在物理世界的局限,在多项任务表现出色。
RL加持的3D生成时代来了!首个「R1 式」文本到3D推理大模型AR3D-R1登场
强化学习首次被系统性拓展到文本到3D生成领域,上海人工智能实验室等机构研究者提出首个强化学习增强的文本到3D自回归模型AR3D - R1,还提出Hi - GRPO范式和MME - 3DR基准,实验显示其性能优异。
Nature新研究:AI竟然分不清事实和信念
斯坦福大学团队在Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存在严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,在高风险领域应用令人担忧。
DeepResearch的概念、核心挑战与进化路径
华为、利物浦大学等研究者撰写综述文章《DEEP RESEARCH AGENTS》,梳理了DeepResearch进展。它由大语言模型驱动,超越RAG等现有技术,介绍其核心技术组件,指出面临的挑战并指明未来发展方向。
GraphRAG,这次被G-Reasoner统一了
大语言模型在知识密集型任务中存在局限,GraphRAG 也有迁移难题。G - Reasoner 提出统一框架,含 QuadGraph、GFM、LLM 增强推理模块,在性能、泛化、效率上全面领先现有方法。
比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA
兔展智能与北京大学的UniWorld团队推出图像编辑模型UniWorld - V2,它提出UniWorld - R1框架,在权威测试中超越顶尖闭源模型。该框架通用性强,能提升其他基础模型性能,相关论文、代码和模型已开源。
为 Agentic AI 的黎明构建地基
文章指出大语言模型虽耀眼,但企业级解决方案需坚实数字底座。在 Agentic AI 时代,数据范式、基础设施哲学都要重塑,智能体模式崛起带来挑战与机遇,技术决策者要做好底座构建。