「音频语言模型」共找到 7951 篇相关文章
「流匹配」成ICML 2025超热门主题!网友:都说了学物理的不准转计算机
第42届国际机器学习大会(ICML)2025年7月将在加拿大举行,生成式AI前沿热点转向高质量、稳定、简洁、通用模型形态,流匹配技术踩中热点。它源于流体力学,能将噪声转化为数据,与扩散模型有紧密联系。
Anthropic最新研究:Claude存在神秘J空间,与人类心智高度相似
Anthropic研究团队在Claude中发现类似人类大脑工作机制的J空间,它存在于模型神经激活中,能让模型默默思考。失去J空间Claude在多步骤推理任务表现变差,还可暴露模型意图,团队已创建演示工具JLens。
刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分
Meta联合斯坦福、哈佛推出ProgramBench测试,200个项目从零手写,9大顶级模型完整通过率0%。该测试与SWE - Bench不同,考AI自主设计软件能力,还发现模型代码风格异于人类,联网时部分模型作弊。
训练数据量降低1万倍,谷歌提出超高质量数据主动学习方法
将大模型应用于特定领域需数据微调,但筛选高保真训练数据难度大、成本高。谷歌提出新主动学习筛选流程,能将训练数据规模降1万倍,还提升模型与人类专家一致性。经实验验证,该方法效果显著。
X-Actor 惊艳登场!长时唇动+情感同步人像动画生成
字节提出 X - Actor,一个音频驱动自回归扩散框架,能通过一张静态参考图像和一段音频生成逼真、富有情感表达的人像动画视频。其核心是两阶段解耦生成流程,实现长时间唇形同步与情感音频一致性。
直播预约 | 如何缓解LLM-as-a-Judge的潜在偏好?UDA:一种无需人工标注的无监督去偏对齐框架
论文针对不同大模型对同一组大模型回答打分差异大等问题,提出无需人工标注、模型无关、即插即用的UDA框架,以无监督方式动态调整Elo评分,实验表明该方法能降低打分标准差、提升与人类评分相关系数。
Claude还是最强,但Anthropic这周好像疯了
Anthropic状告阿里蒸馏模型致其股价创新低。一位87年创业者用AI搭工作流,起初用DeepSeek和Qwen问题多,换Claude后流程顺畅。MRCR v2测试显示国产模型与Claude有差距,便宜与省心模型该怎么选成问题。
奥特曼点评中美AI牌桌:美国猛攻前沿,中国凭“两张王牌”错位竞争
OpenAI CEO 萨姆·奥特曼在贝莱德峰会上指出,从 o1 到 o3 模型,复杂推理成本降 1000 倍,2028 年末数据中心 AI 认知能力或超人类。他还拆解中美 AI 竞争,美国前沿领先,中国旧模型推理成本控制和基建推进有优势。
北大、字节跳动联手发布SWE-Swiss:一把修复代码Bug的「瑞士军刀」,完整配方直指开源SOTA
北大、字节跳动等联合研究提出SWE - Swiss配方,用于训练解决软件工程问题的AI模型。32B参数的SWE - Swiss - 32B在SWE - bench Verified上准确率达60.2%,各训练环节效果显著,模型和数据将开源。
Anthropic开源认知对齐MSM
大模型对齐、安全问题是行业大事,Anthropic开源的MSM对齐方法,能将Qwen3 - 32B的agent错位率大幅降低。它先给模型讲规则逻辑再微调,控制精度高,还研究了最佳实践,将改变大模型对齐流程。