「视觉 - 语言智能体」共找到 4653 篇相关文章
DeepSeek比你更懂反思!谷歌重磅发现,智能的本质竟是一场社会化对话
谷歌等机构研究发现,像DeepSeek - R1等推理模型思考复杂问题时,内部模拟多角色辩论赛,形成思维社会机制,让AI准确率提升,证明智能本质或是内化社会互动,还为调优AI提供新方法。
DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro
DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。
当 Token 成为商品,AI 基础设施会怎么变化?
在大模型时代,智能生产和交付未实现工业化,存在性能鸿沟。九章云极提出AI工厂战略,发布Alaya NeW Cloud 3.0,将从资源计量转向智能计量,打造训练和Token工厂,提升算力到有效Token的转化效率。
DeepMind入股硬核网游EVE,要让AI学「黑暗森林」
本周四,Google DeepMind宣布收购《EVE Online》开发商部分股权,将用该游戏研究智能。EVE是高度自由化的沙盒游戏,玩家驱动性强。此前EVE就与科研有跨界合作,此次合作令人期待AI智能体的表现。
ACL 2026 | 赋予视频生成「视觉思维链」:VChain显式建模时空规划与状态演变
南洋理工大学团队在ACL 2026发表VChain框架,引入大模型视觉推理能力提升视频逻辑连贯性。它分三步实现,实验效果超现有方法,还展示视频推理与生成的潜在趋势,为多模态模型协作提供范例。
梅卡曼德获豪华基石阵容认购:具身智能眼脑手第一股即将挂牌|甲子光年
8月24日,梅卡曼德启动港股招股,拟9月1日挂牌。其为机器人提供眼脑手组件,2025年全球市占率第一。业务增长快、海外收入过半,获豪华基石阵容认购,超八成募资将投向研发等。
支持30种语言,多种中文方言 [四川话、粤语等]的颠覆性无分词器TTS系统
VoxCPM是无离散音频分词器的语音合成系统。VoxCPM2基于MiniCPM - 4构建,有20亿参数,支持30种语言和9种中文方言,具备音色设计、可控声音克隆等特性,还完全开源,商用就绪。
刚刚,国产AI自己造了AI,全球首例!
面壁智能实现全球首例国产AI造AI,用AI编写预训练框架ForgeTrain,性能超英伟达Megatron,还训练出MiniCPM5 - 1B模型。该模型可作桌宠,小尺寸高智能,还能自定义人格,提供工具链。
DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍
扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。
微软发布5大AI Agent模式:一键解锁AI员工,打造智能体工厂
今天凌晨微软官网发布5种常用Agent模式助用户开发自动化AI员工。智能体比传统自动化工具更具优势,能推理协作等。各模式都有应用案例,且Azure AI Foundry支持多Agent模式开发。