任务设计」共找到 3084 篇相关文章

产品应用7

Claude Chrome 插件使用体验:强大,但有点慢

作者分享Claude for Chrome插件使用体验,介绍使用流程,测试让其查看马斯克推文,结果准确。该插件能力强且通用,但存在慢、焦点抢占问题,还提到与deepresearch及云厂商设备的差异。

AGI Hunt
开源动态8

AI 本地跑?Google 新开源模型上线,本地量化后占用不到 200MB 内存,支持百余语言

Google DeepMind推出开源嵌入模型EmbeddingGemma,专为本地设备高效运行设计。它用Matryoshka方法和量化感知训练,提升效率。在MTEB测试中成绩佳,支持百余种语言,内存占用少,已集成多种工具。

InfoQ
产品应用7

蚂蚁即将上线通用 Agent

蚂蚁百宝箱团队将在今年外滩大会正式上线 Tbox 超级智能体,其产品形态与部分平台相近,能让不同角色分工协作。实测显示它在多方面表现不错,但也存在细节不足,官网有诸多案例。

特工宇宙
新闻资讯7

特斯拉下一代金色Optimus原型现身?一双「假手」成为最大槽点

Salesforce CEO发布与金色Optimus对话视频,盛赞其开启物理智能体革命。不过,其高昂价格、“假手”设计引争议。对比Figure机器人精准装碗视频,特斯拉Optimus表现不尽如人意,是否遇麻烦引人猜测。

机器之心
算法论文8

腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”

视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。

深度学习自然语言处理
算法论文8

ICLR2025 | LLM为什么能拒绝回答有害问题呢?

该论文首次系统性研究注意力头在LLM安全中的作用,提出Ships和Sahara方法,在极少参数改动下显著降低模型安全性,发现不同模型安全头高度重叠,为理解模型安全机制提供新视角。

深度学习自然语言处理
开源动态8

Chain-of-Agents: OPPO推出通用智能体模型新范式,多榜单SOTA,模型代码数据全开源

OPPO个性化AI实验室团队推出智能体推理范式CoA及模型AFM,解决传统多智能体系统通信效率低等问题。AFM在近20项测试中刷新记录,降低推理成本,还介绍了架构、数据构建等,也指出待探索方向。

机器之心
算法论文8

ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式

北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。

机器之心
产品应用8

刚刚,智谱推出全球首个手机通用Agent,人人可用

智谱发布新版AutoGLM,是全球首个手机通用Agent。它为用户配备云端手机,能在不影响用户操作的前提下完成各类任务,还在技术上有重大突破,成本更低,代表全新互联网流量。

AGI Hunt
开源动态8

谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草

大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。

新智元