「任务性能」共找到 3542 篇相关文章
肖涵:2026 年的 AI 搜索就是智能体记忆 | Elastic 中国 AI 搜索技术大会
2026 年智能体记忆成 AI 基建新战场,虽概念不新但获前所未有的紧迫感。因智能体任务变长但记性差,加记忆后又有记不住该记、忘不掉该忘的问题,遗忘成最大难题,产品分三条技术路线。
字节最强多模态模型登陆火山引擎!Seed1.5-VL靠20B激活参数狂揽38项SOTA
5月13日,火山引擎在上海发布5款模型和产品,其中豆包1.5・视觉深度思考模型(Seed1.5-VL)最吸睛。它激活参数20B,性能与Gemini2.5 Pro相当,38个评测基准达SOTA,推理成本低,已开放API。
混元开源PhoneBuddy-4B与5篇系列论文:多项手机Agent真机评测超过GPT-5.4
腾讯混元Phone - use Agent团队发布PhoneBuddy - 4B及5篇系列论文。研究探讨如何训练真实可用的Phone - use Agent,采用Real + Mock方式,实验显示该方法提升效果显著,4B模型多项任务超GPT - 5.4。
The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者
Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。
老黄怒怼玩家根本不懂AI!英伟达新AI功能遭全网抵制,游戏圈炸锅了
英伟达在GTC 2026发布DLSS 5,本应是“性能革命”,却遭游戏圈抵制。它用生成式AI“注入”光影和材质,从“帮放大画面”变为“帮重绘画面”,玩家不满AI网红脸,老黄称是“GPT时刻”。
开源“裸考”真实世界,国产具身智能基座模型拿下全球第二!
国产具身智能基座模型WALL - OSS在RoboChallenge真机评测榜单获全球第二,多个单任务排第一。它是开源模型,开源程度彻底。还介绍其技术突破及团队情况,强调开源对具身智能发展意义重大。
VLNVerse“宇宙降临”:吴琦团队交出2025具身导航最终答卷
自2018年吴琦团队发表首篇VLN论文后,领域碎片化问题凸显。2025年末其推出全栈平台VLNVerse,涵盖场景生成、物理模拟、任务基准和通用模型,欲打通Real2Sim2Real,推动VLN向Embodied VLN跨越。
谷歌2.5 Image:『你是我的神』,准备丢掉PS了
谷歌新出的大模型Gemini 2.5 Flash Image实现AI图像创作一致性、真实性新高度。它能理解手绘图表、解答问题及完成复杂编辑指令,可在Gemini和Google AI Studio免费使用,表现出色,有望取代很多PS任务。
GPT-5基准测试泄露,被曝两天后发布?打Minecraft震撼开挂网友直呼封神
GPT - 5消息不断,泄露的基准测试及Minecraft实测惊艳网友。有爆料称7月31日发布,也有消息指8月。它或统一o与GPT系列,编码能力强,能处理复杂编程任务,不过也引发对其影响的担忧。
全球首次,「AI记忆」开源落地!MIRIX同步上线APP
加利福尼亚大学圣迭戈分校博士生王禹和纽约大学教授陈溪联合推出并开源全球首个多模态、多智能体AI记忆系统MIRIX,还上线桌面端APP。MIRIX性能远超传统方法,首次将记忆分六模块,用多智能体系统控制。