「大模型发布潮」共找到 10174 篇相关文章
让机器人在“想象”中学习世界的模型来了!PI联创课题组&清华陈建宇团队联合出品
斯坦福Chelsea Finn课题组与清华陈建宇团队联合提出可控生成世界模型Ctrl - World,可让机器人在“想象空间”预演任务。该模型使用零真机数据,提升下游任务指令跟随成功率。其相关论文已发布于arXiv平台。
机器人视觉语言导航进入R1时代!港大联合上海AI Lab提出全新具身智能框架
香港大学与上海AI Lab联合提出VLN - R1,可将自然语言指令转化为连续导航动作,打破传统链条。它有两阶段训练等创新支柱,在测试中表现出色,小模型性能佳,推动具身智能从数字向具身认知跨越。
开源DeepSeek R1增强版:推理效率快200%,创新AoE架构
德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三大模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本大减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。
Grok 4源代码刚刚泄露!上线倒计时,马斯克xAI估值破1130亿,大模型要变天
xAI再获百亿美元融资,估值飙至1130亿。xAI控制台已有Grok 4和Grok 4 Code源代码流出,计划7月4日后发布。Grok 4智能无与伦比,或打破o3在榜单的领先地位,xAI将成OpenAI等对手。
给 iPhone 装个“最强本地大脑”:Google 开源模型 Gemma 4
Google 4 月初发布开源模型 Gemma 4,可离线运行在 Google AI Edge Gallery 上。它在多项基准表现出色,采用 Apache 2.0 协议,开发者可集成到 App。还介绍了在 iPhone 离线使用方法及适用场景。
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。
DeepSeek-V3.1 发布,官方划重点:Agent、Agent、Agent!
2025年8月21日,DeepSeek V3.1正式发布。它采用混合推理架构,支持双模式,网页端、App、API均升级,上下文拓展至128K。其智能体能力增强,思考与输出效率提升,还具备API新特性,模型已开源,价格也将调整。
当模型成为公共基础设施,特赞如何架构企业级 Agentic AI?
当大模型成公共基础设施,企业需构建围绕业务结构的智能系统架构。特赞提出的 GEA 企业级智能体架构体系,围绕企业业务运行结构设计,能让智能体参与企业经营判断。
腾讯组织大调整,前 OpenAI 研究员姚顺雨担任首席 AI 科学家
腾讯进行组织架构大调整,成立AI Infra部等部门。前OpenAI研究员姚顺雨出任首席AI科学家,兼任多职。此次调整旨在整合模型、数据、算力,腾讯还大力招募人才,此前元宝借开源起量,凸显自研重要性。
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。