多任务能力」共找到 7228 篇相关文章

产品应用8

谷歌翻译重大更新:实时翻译,全球无障碍交流摩擦苹果

Google搜索产品副总裁宣布Google翻译引入Gemini模型,翻译能力飞跃。更新含顶尖文本翻译、实时语音对话翻译(Beta版)及扩展语言练习功能,适用平台语言,谷歌期待用户反馈以优化体验。

AI寒武纪
算法论文8

ETT:打破原生模态学习视觉瓶颈,重塑视觉tokenizer优化范式

本文由机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在模态理解、生成、重构任务表现出色,虽有局限但带来新突破。

机器之心
算法论文8

大模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!

随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力

深度学习自然语言处理
算法论文8

让RAG真正读懂“言外之意”!新框架引入词汇样性,刷新项基准SOTA

ACL 2025研究提出Lexical Diversity - aware RAG (DRAG) 框架,将词汇样性引入RAG检索与生成,解决现有方法痛点。它有两大创新模块,实验在基准提升准确率,还将在模型上增益,代码即将开源。

量子位
推荐文章7

Anthropic实践发现:Multi-Agent系统的核心仍然是Prompt设计!

近期Anthropic分享构建智能体研究系统最佳实践,提出8条研究智能体的提示工程与评估原则。其架构采用协调者 - 工作者模式,与传统RAG方法不同,使用步骤搜索动态查找信息。

PaperAgent
开源动态8

给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集

随着模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。

机器之心
算法论文7

研究表明:资深开发者在使用AI工具时,完成任务的时间比不使用时延长了19%。

研究通过随机对照试验,发现2025年初资深开源开发者使用AI工具完成任务时间比不使用时延长19%。当前衡量AI能力依赖标准化评测,可能高估或低估其真实能力,研究旨在更准确评估。

宝玉AI
开源动态8

Chain-of-Agents: OPPO推出通用智能体模型新范式,榜单SOTA,模型代码数据全开源

OPPO个性化AI实验室团队推出智能体推理范式CoA及模型AFM,解决传统智能体系统通信效率低等问题。AFM在近20项测试中刷新记录,降低推理成本,还介绍了架构、数据构建等,也指出待探索方向。

机器之心
新闻资讯8

8.99万的人形机器人来了!中国版Figure发力,价格打穿地板

星尘智能发布T1新品,价格8.99万元起,6月发货。它强调商业化能力,能「一机用」,打穿场景。星尘自研「AI模型 - 具身OS - 绳驱本体」架构,已量产,订单,领先同行。

新智元
开源动态8

马斯克转发字节Seed&哥大商学院新基准:大模型搞金融,连查个股价都能出错

字节跳动Seed团队与哥大商学院推出开源金融搜索与推理基准测试FinSearchComp,含635个问题。评测显示大模型处理金融任务有差距,凸显金融AI能力评估重要性,还揭示了关键能力差距。

量子位