全模态大模型」共找到 8677 篇相关文章

开源动态8

流程国产GPU,上下文提速100倍!中国科学院发布「线性复杂度」类脑大模型

中国科学院自动化所李国齐、徐波团队发布国产自主可控类脑脉冲大模型SpikingBrain-1.0,训练推理用国产GPU。它具线性复杂度,超长序列处理速度快,还开源7B模型,为类脑智能发展提供新思路。

新智元
新闻资讯8

从Token到词元:模态时代的基模与交互入口

2026年3月24日国家数据局确立“词元”为Token标准译名,Token生成与消耗方式在多模态场景正发生变化。模思智能获数亿融资,探索从语音到模态的路径,成果颇丰且完成能力闭环,其发展受关注。

量子位
产品应用8

国内首个!加入六维力的感知数采,让VLA模型进化出力触觉

具身智能发展受数据采集制约,开普勒机器人发布国内首个原生感知力触数采系统,打通链路闭环。该系统具平台化特征,让具身智能范式转变,还获融资并升级战略,在工业场景表现出色。

机器之心
新闻资讯8

C罗刚头球破门,AI解说脱口而出!模态实时流太狠了

2026世界杯正热,阿里云在Flink Forward Asia 2026大会宣布Apache Flink 3.0进入Agentic Streaming For AI时代,推出模态数据流处理能力,可让AI实时解说比赛。Flink 3.0解决了流式Agent数据处理难题,已有智能运维等应用场景。

新智元
开源动态8

AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒!

行业争论30B能否挑战万亿参数时,清华大学等联合研发的AgentCPM - Explore智能体模型用仅4B参数,在深度探索类任务有出色表现,且开源流程配套工具,打破小模型性能局限。

MCP Server
开源动态8

从VLA到RoboOmni,模态具身新范式让机器人察言观色、听懂话外音

复旦大学等联合推出模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现面领先。

机器之心
产品应用7

高考数学卷重赛!一道题难倒所有大模型,新选手Gemini夺冠,豆包DeepSeek并列第二

因网友质疑上次测评不严谨,此次用六款大模型挑战含解答题的套高考数学题。结果Gemini 2.5 Pro夺冠,Doubao和DeepSeek R1并列第二。解答题是失分重灾区,图像题难倒多模态模型

机器之心
产品应用8

具身数据才是最大「金矿」,数据云商城来了:球首个、百亿级、模态、高自由度

帕西尼联合京东云等打造的球首个百亿级模态具身智能数据云商城开放。该平台解决具身智能泛化瓶颈,提供模态数据,有端到端服务,数据质量高、体量大,还能加速具身智能进化,赋能多行业。

机器之心
开源动态8

新型开源端到端 AI 语音模型!Voila:195ms 超低延迟引领双工对话!

Maitrix团队发布开源AI端到端语音模型Voila,以195ms超低延迟及双工对话受关注。它功能强大,支持多语言,有多种使用方式,适用于多个场景,架构采用模块化设计。

开源星探
开源动态8

谷歌Gemma 4系开源:3.8亿激活超越20倍体量模型,手机秒变AI工作站

谷歌发布Gemma 4系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试中成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。

AIGC开放社区