「新视角合成」共找到 3844 篇相关文章
1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!
在文本转语音(TTS)领域,生成长篇、多说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。
全球首个人形机器人通用视觉感知系统,Humanoid Occupancy建立多模态环境理解新范式
北京人形机器人创新中心推出 Humanoid Occupancy 感知系统,创新性融合多模态传感器信息,构建通用感知框架。它以语义占用表征为核心,有全编码和适配融合优势,经实验验证性能优,推动机器人迈向通用感知时代。
国产AI首次「长出」原生记忆,非Transformer架构成新王!机器狗当场引爆WAIC
WAIC世界人工智能大会上,国产黑马RockAI的大模型Yan 2.0 Preview亮相,可多终端无损部署。它基于非Transformer架构,训练效率高,有原生记忆,实现端侧AI,展现出自主学习和多模态能力,引发关注。
“AI大神”李沐终于开源新模型,爆肝6个月,上线迅速斩获3.6k stars!
7月23日,“AI大神”李沐开源音频基础模型Higgs Audio v2,构建于Llama - 3.2 - 3B之上,预训练数据丰富。该模型在多个测评中成绩领先,有多种能力,李沐介绍其技术及训练方法。
面向 AI Agent 的搜索服务,小宿科技有机会成为百亿美金的新巨头吗?
文章围绕AI搜索展开,分析微软Bing停用API原因,探讨小宿科技做Agent时代AI搜索服务的机会。从多方面剖析小宿优势,如全球通能力、贴合需求打法等,指出AI时代搜索是B端基建博弈。
美团提出多模态推理新范式:RL+SFT非传统顺序组合突破传统训练瓶颈
美团研究者提出Metis - RISE框架,将RL激励和SFT增强以非传统顺序结合提升多模态大语言模型推理能力。先RL激发潜能,再SFT补齐短板,训练的两模型在OpenCompass榜单成绩优异。
OpenAI 的“编程”新范式?其实是瀑布模型的回魂:“听 PM 的话、写需求文档”
在AI工程师大会上,OpenAI研究员Sean Grove提出“规范驱动开发”,认为清晰规范将取代代码成软件开发核心。此观点引发讨论,有人认同,有人反对,也代表了AI编程从“造轮子”到“定方向”的转折。
OpenAI 的“编程”新范式?其实是瀑布模型的回魂:“听 PM 的话、写需求文档”
在今年AI工程师大会上,OpenAI研究员Sean Grove提出在AI驱动时代,清晰规范将取代传统代码成软件开发核心产物。他认为编程核心是结构化沟通,该转变是工程实践未来方向,但引发诸多讨论。
1万tokens是检验长文本的新基准,超过后18款大模型集体失智
Chroma团队研究发现,将上下文扩展至1万tokens,18款主流大模型集体“失智”,“智商”非均匀下降,在一些节点会断崖式下跌。研究还设计四项对照实验,证明LLMs性能随输入长度增加显著且非均匀下降。
UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力
大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。