音频理解」共找到 905 篇相关文章

新闻资讯7

AI 时代的新可观测性:不只看系统崩没崩,还要看模型有没有胡说

New Relic首席技术战略官Nic Benders与主持人探讨可观测性从传统到AI驱动的演进,提及LLM与统计方法协同处理海量数据,还讨论了监控AI系统的难题及可观测性核心是理解业务目标。

InfoQ
算法论文8

无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案

近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。

机器之心
开源动态8

TabClaw:让 AI 真正读懂你的表格数据

TabClaw 是面向表格数据的 AI 分析 Agent,能让 AI 真正读懂表格数据。它核心标签是全透明与持续进化,工作流分显式和隐式两层,目标是成为真正理解用户、能一起成长的表格分析伙伴,项目已开源。

PaperAgent
算法论文8

CVPR 2026|清华联合美团推出3DThinker,首个用3D意象思考的工作

当前多模态大模型在空间理解任务表现弱,缺乏对几何信息提取能力。清华联合美团推出3DThinker,无需3D标注和外部工具,让模型内蕴‘想象’三维场景,在多基准上提升效果,且具备一定可解释性。

机器之心
新闻资讯8

黑马图像模型被Nano Banana技术负责人点赞!15人华人小队,DDIM之父&CVPR最佳论文作者带队

Luma AI推出全新图像模型Uni - 1,对标谷歌Nano Banana Pro和GPT Image 1.5。它是统一图像理解与生成模型,多项评测表现出色。背后是不到15人的华人团队,由DDIM之父和CVPR最佳论文作者带队。

量子位
开源动态8

不止是 Claude Code 平替:这个开源 CLI 还支持“多模型协作 + 子代理并行”

Kode 定位是在终端中完成代码库理解、文件编辑、命令执行等开发流程,有三大亮点:将多模型协作设为核心能力;支持 AGENTS.md 文档模式;终端体验好,有强大的补全系统。还介绍了使用方法和适用人群。

小华同学ai
开源动态8

突然,被GLM-4.7的Coding交付能力惊到了

国内大模型圈因智谱启动A股上市而兴奋时,GLM系列再展“卷王”姿态,本月开源旗舰GLM - 4.7。它从代码大模型变为任务交付引擎,实测在多场景表现出色,能理解复杂意图、交付高质量代码。

PaperAgent
产品应用8

MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV

上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。

AIGC开放社区
开源动态8

英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万

英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。

新智元
算法论文8

刘鹏飞组发布上下文工程2.0:人机交互的全新视角

刘鹏飞组论文《Context Engineering 2.0: The Context of Context Engineering》重新梳理上下文工程领域。它追溯其20多年历史,给出形式化定义与四阶段模型,探讨关键问题,将其从技术技巧升为系统学科,为理解人机交互提供新视角。

深度学习自然语言处理