全模态统一」共找到 2270 篇相关文章

开源动态8

小红书发布FireRedChat:首个可私有化部署的双工大模型语音交互系统

小红书智创音频团队推出业内首个支持私有化部署的双工大模型语音交互系统FireRedChat,可将半双工链路升级为双工,提供级联与半级联服务,在多指标领先,让AI有“人感”。

机器之心
算法论文8

复旦、同济和港中文等重磅发布:强化学习在大语言模型周期的面综述

来自多所顶尖科研机构的研究者完成长文综述,总结大语言模型生命周期的强化学习研究,阐述其各阶段应用策略,分析未来挑战与趋势,重点关注 RLVR 技术,有生命周期梳理等三大贡献。

机器之心
产品应用7

15岁进少年班,97后打造「元点机器人宇宙」:栈技术自研领跑家庭机器人赛道

元点Zeroth发布尺寸人形Jupiter和异构机械臂家庭协作机器人N1,强调与人类长期共生关系。其创始人是97年的郭人杰,公司已累计融10亿。元点有栈技术体系,走渐进式落地路线。

新智元
推荐文章8

AI Coding 之后,如何让 Agent 进入企业研发链路?得物推荐的 Harness 实践

得物资深技术专家白忠魏在AICon大会分享实践。团队目标是将AI Coding扩展为链路方法,介绍了PDCA循环、链路前提、七阶段护栏等探索,还提及用知识体系和混合Agent架构解决问题,已有阶段性成果。

InfoQ
开源动态8

社区发布丨面开源!商汤日日新SenseNova U1发布,迈向模型理解生成统一时代

商汤科技正式发布并开源商汤日日新SenseNova U1系列原生理解生成统一模型,基于NEO - unify架构,实现模态集成向原生统一跨越,其轻量版在多项测试达同量级开源SOTA,还能连续性图文创作。

Hugging Face
算法论文8

ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化

NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。

机器之心
新闻资讯8

Gemini 首次反超 ChatGPT,谷歌CEO劈柴哥复盘:不止是十年算力与栈豪赌,更是找回了“老谷歌”那个味儿

截至2025年底,Gemini在桌面和移动网页端单次使用平均停留时长超ChatGPT,下载量也快速追赶。谷歌CEO Sundar Pichai称这是栈投入成果,还提及早期谷歌文化回流,也谈到未来十年押注等内容。

InfoQ
新闻资讯7

阿里云容器服务覆盖AI流程,团队透露:OpenAI训练GPT时就用了我们的开源能力

拿下中国AI云市场第一后,阿里云技术产品负责人开展AI Infra分享会。其栈云计算搭好技术架子,10万GPU集群高效互联,容器服务贯穿AI流程,还透露OpenAI训练GPT时用了其开源能力。

量子位
新闻资讯8

爆发力超越波士顿动力液压机器人,PHYBOT M1实现球首次尺寸重型电驱人形机器人完美拟人态后空翻

动易科技的尺寸人形机器人PHYBOT M1实现球首次尺寸重型电驱机器人完美拟人态后空翻,其爆发力超波士顿动力Atlas。这是对其动态性能的压力测试,电驱系统也在多方面超越液压方案。

量子位
新闻资讯8

Gemini 首次反超 ChatGPT,谷歌CEO劈柴哥复盘:不止是十年算力与栈豪赌,更是找回了“老谷歌”那个味儿

截至2025年底,Gemini在桌面和移动端单次使用平均停留时长首超ChatGPT,下载量也快速追赶。谷歌将其嵌入自家生态策略见效,这与Gemini 3推出有关,还体现了栈能力与早期谷歌文化回流。

AI前线