多模型推理」共找到 10009 篇相关文章

开源动态8

1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!

在文本转语音(TTS)领域,生成长篇、说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。

开源星探
算法论文8

ICML 2026 现场|九篇 Spotlight 论文,透视 AI 最前沿

7月7日,ICML 2026正会首日,雷峰网精选九篇Spotlight论文,涵盖生成模型、智能体系统等领域。如SDEVI框架解决不规则时间序列生成难题,MASpoB让智能体提示优化可行等。

AI科技评论
产品应用7

Nano Banana Pro或将引爆新安全危机

基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制能力提升。它展现出复杂推理能力,能理解反光、推理指纹,但这或带来隐私危机。

AI工程化
算法论文8

上海人工智能实验室让AI像科学家一样在探索中发明工具

上海人工智能实验室等团队提出推理时工具演化(TTE)框架,推动AI在科学领域从被动选工具到主动发明工具。它解决传统工具库问题,提升学科推理准确率,赋予AI跨学科迁移能力。

AIGC开放社区
产品应用8

谷歌翻译重大更新:实时翻译,全球无障碍交流摩擦苹果

Google搜索产品副总裁宣布Google翻译引入Gemini模型,翻译能力飞跃。更新含顶尖文本翻译、实时语音对话翻译(Beta版)及扩展语言练习功能,适用平台语言,谷歌期待用户反馈以优化体验。

AI寒武纪
开源动态8

惊艳!GitHub 开发者一键接入!4.2k star 项目 Champ,用一张照片秒变动画

Champ项目致力于从一张静态人物图生成人体动画,将3D参数化人体模型引入扩散模型。它解决了传统动画效果不真实等痛点,有诸核心功能,技术优势明显,在领域有高应用价值。

小华同学ai
新闻资讯7

Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨

2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。

AIGC开放社区
新闻资讯8

2026「中国 AGI 创新影响力机构 TOP 30」发布

过去一年 AI 行业变化溢出模型层,Coding Agent 铺开,视频生成实现商业变现,具身智能供应链成型。Founder Park 从四维度选出「中国 AGI 创新影响力机构 TOP 30」,涵盖领域团队。

Founder Park
算法论文8

2篇最新152页论文,RL+LLM被彻底讲透了!

今天分享2篇2025最新RL×LLM的技术综述,分别聚焦“RL在LLM全生命周期的打法”和“RL如何炼成大推理模型”,梳理玩法、组件、算法演进等内容,还给出开源模型、数据等盘点。

PaperAgent
算法论文8

CMAME|美国西北大学,德州大学|Wing Kam Liu及 TJR Hughes 等: LLM赋能的下一代计算机辅助工程

工程仿真里有限元方法常见,但计算与人力成本高。此研究提出把大语言模型变为计算机辅助工程智能体,开发不依赖训练数据的降阶求解器,在问题上表现佳,为下一代计算机辅助工程提供框架。

力学与人工智能