「多任务能力」共找到 7296 篇相关文章
没有全科优秀,具身模型别想进入百万小时
文章介绍权威评测 RoboDojo,给全球机器人模型办‘高考’,多数具身模型离落地远。原力灵机的 DM0.5 模型登顶,它记忆能力强、全科优秀,且全面开源,有望推动具身智能发展。
The Batch: 968 | Muse Code 想获取你的数据
Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。
图灵奖得主首度入局中国物理AI公司:曹操出行凭什么?|甲子光年
Robotaxi行业竞争重点转向安全可信能力建设。6月29日,图灵奖得主约瑟夫·希发基思出任曹操出行AI创新中心首席科学顾问,其理论可补全自动驾驶可信论证体系,助曹操出行搭建全链路可信AI底层安全框架。
小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源
微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。
行为记忆+认知记忆,中科大MemWeaver重构LLM个性化记忆
论文MemWeaver被The Web Conference 2026接收,它聚焦用户从隐式到显式文本交互时个性化生成的升级问题。提出将用户历史升级为层次化记忆,构建行为与认知双记忆模块,主实验表现优,消融实验验证其结构设计关键。
上交大54页综述讲透Agent认知外部化的演进之路
上海交大联合多机构提交综述论文,首次以「外部化」为统一视角,梳理了LLM Agent的记忆、技能、协议与Harness工程四大支柱。指出Agent实际进展取决于外部认知基础设施,而非模型能力提升。
成本降70%!清华、阿里通义带来智能体长程任务新解法
AI智能体处理长程任务常遇上下文超载问题。清华与阿里通义研究人员提出MemPO算法,赋予大模型主动管理记忆能力,准确率提升,计算资源消耗降近七成,不过评价机制有局限。
Github持续上榜,这款 AI 自动渗透项目真有点东西!
传统渗透测试依赖人工,效率不高。开源项目PentAGI将‘AI Agent + 渗透测试’结合,能自动完成渗透测试任务,有自主决策能力,功能特性丰富,安装使用较方便,虽有局限但值得尝试。
智谱发布龙虾基座模型GLM-5-Turbo,还适配了一个养龙虾的盒子
智谱发布专为龙虾场景深度优化的基座模型GLM - 5 - Turbo,从底层训练重塑,增强四项核心能力。发布评测基准ZClawBench,模型表现领先。还推出龙虾套餐和安全管理体系,助力企业实现算力自由与安全管控。
Google Gemini Embedding2:一个模型处理所有媒体类型
Google发布Gemini Embedding 2,首个原生多模态嵌入模型。能处理文本、图像等多种媒体类型,支持交错输入,覆盖超100种语言。与多模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。