「多模型推理」共找到 10114 篇相关文章
让机器人学会「预判接触」:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题
它石智航联合四大顶尖机构发布论文 “TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人能提前预判接触变化,在真机验证中性能优异。
腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容
腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型。
ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,看o3、R1哪家强
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。
21.7K 标星的开源TTS!FishAudio开源情感语音核弹:200万小时炼成“声优AI”!
FishAudio团队推出新一代TTS语音模型OpenAudio S1,基于200万小时音频数据训练,采用Qwen3+Descript Audio Codec架构。它能实现情感表达,在TTS - Arena榜单登顶,还提供不同版本适配,适用场景广泛。
智源研究院发布中英文高质量数据集CCI4.0,推动全球人工智能开源创新
2025年5月6日,智源研究院在全球开源创新论坛发布中英文高质量数据集CCI 4.0,同步在多平台开源。CCI 4.0规模大,处理严格,此前CCI系列反响好,未来将持续建设中文预训练语料库。
OmniInsert:全新无掩码视频插入技术
基于扩散模型的视频插入技术发展快,但以往方法有局限。字节提出InsertPipe和OmniInsert,解决数据不足等难题。OmniInsert设计巧妙,还建立评测平台InsertBench,虽有小问题,但推理快,可加速优化。
AI体育教练来了!中国团队打造SportsGPT,完成从数值评估到专业指导的智能转身
现有智能体育系统多停于‘打分+可视化’,通用大模型处理体育生物力学分析有局限。中国团队提出SportsGPT框架,实现从‘动作评估’到‘训练处方’智能闭环,各模块优势明显,超越基线。
OpenAI连破10道数学难题,Fable 24小时「复现」5道
这个周末,OpenAI与Anthropic两大AI巨头在数学前沿短兵相接。先是OpenAI用未发布模型Astra证明10项数学成果,不到24小时,Anthropic的Fable复现了其中5项。AI解难题成本降低,成果验证成新考验。
深度|AI开始接管物理世界,谁来掌握新的入口?
本文为深度行业分析,围绕Anthropic推出的模型硬件标准MHS展开,探讨AI从虚拟屏幕切入真实物理世界、接入实验设备的产业进程,梳理核心挑战与未来竞争格局。
效果、性能双突破,快手OneSug端到端生成式框架入选AAAI 2026
查询推荐是电商搜索关键功能,传统方法有局限。快手提出OneSug端到端生成式框架,统一多阶段,提升效果与效率,成果入选AAAI 2026,已在快手电商全量推广,显著提升多项指标。