端到端语音模型」共找到 8012 篇相关文章

新闻资讯7

OpenAI内部大重组!模型行为团队并入Post Training,负责人另起炉灶

OpenAI对模型行为团队重组,其创始负责人Joanne Jang组建OAI Labs,探索人与AI协作新范式。模型行为团队约14人并入Post Training,OpenAI还完成系列人事调整。

量子位
新闻资讯8

模型的进化方向:Words to Worlds | 对话商汤林达华

量子位对话商汤林达华,探讨大模型发展。商汤的SenseNova - SI超越李飞飞团队模型,林达华认为单纯依赖参数规模的AI范式遇瓶颈,商汤推出NEO架构革新,还在落地应用优化,为年轻人指明新赛道。

量子位
推荐文章7

模型的第一性原理:(二)信号处理篇

本文从信号处理角度解读大模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出大模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。

机器之心
算法论文7

重塑你的vlog!PickStyle打造稳定的视频风格迁移模型

Pickford提出PickStyle,这是基于扩散模型的视频到视频风格迁移框架。它结合上下文–风格适配器和CS–CFG机制,能在保持画面连贯时准确迁移风格,还能避免闪烁等问题,不过也继承了基础模型部分缺陷。

带你学AI
新闻资讯8

人形机器人交付元年,行业从卷模型转向拼数据

2026年是具身智能交付元年,行业从卷模型转向拼数据。全球权威机构重新定义“人形机器人数据”地位,真机数据是模型落地关键。乐聚等企业积极布局,通过训练场模式获取数据,解决行业痛点。

DeepTech深科技
新闻资讯8

华为重金押注的世界模型公司,新融了10个亿!

具身基模和通用机器人企业极佳视界完成近10亿元Pre - B轮融资。其具身基模全球领先,国内首家布局世界模型,原生本体开启量产,在多场景有开创性应用,获产业巨头和顶尖资本认可。

量子位
推荐文章8

大语言模型的解耦:人工智能基础设施的下一轮进化

人工智能模型发展快,但基础设施滞后,传统单体式服务器架构成瓶颈。文章介绍大语言模型推理的预填充与解码阶段差异,指出解耦架构可突破困境,还阐述其经济影响、实施策略、应用案例及未来展望。

InfoQ
新闻资讯7

理解与生成统一多模态模型:现状与未来 | 直播预约

从GPT - 4o到Gemini,AI实现跨模态联合理解与生成,核心是统一多模态基础模型。但开源社区构建强大统一模型面临挑战。南大等团队梳理超750篇论文分析技术路线,将有直播探讨现状与未来。

深度学习自然语言处理
算法论文8

机器人学会“脑补”触感,叠衣服茶水成功率暴涨90%

近年来,人形机器人研发从行走转向复杂操控,但处理精细家务表现逊色。卡内基梅隆大学联合博世人工智能中心团队提出 HTD 模型,让机器人预判触觉,在 5 项任务上成功率提升 90.9%,部分代码开源。

DeepTech深科技
算法论文7

全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%

MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。

量子位