测试时深思」共找到 2277 篇相关文章

开源动态8

阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源

阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。

量子位
开源动态8

突破传统检索瓶颈!阿里通义实验室发布 WebDancer,开启多步推理智能体新范式!

在信息爆炸代,传统检索技术缺乏动态决策能力,难以满足多步推理需求。阿里通义实验室发布的 WebDancer 基于 ReAct 框架,通过四阶段构建,在测试中表现优异,未来规划拓展工具生态、突破任务边界等。

开源星探
产品应用7

The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者

Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。

DeeplearningAI
新闻资讯7

刚刚,GPT-5.4核心内幕炸裂剧透!或拥有永久记忆,极限推理狂飙

多方消息显示GPT - 5.4已开启测试,多次意外曝光。它或有极限推理模式、翻倍上下文、长任务表现佳,甚至可能拥有永久记忆。OpenAI因对手紧逼,模型更新接近月更。

新智元
新闻资讯7

今天,Claude Cowork大更新!合上电脑,它替你彻夜打工

Anthropic官宣Claude Cowork正式登陆手机和网页端,Chat和Cowork合并成一个入口。Cowork可脱离设备在云端运行,完成工作闭环,还能让用户在看球赛、赶飞机用手机‘监工’,巨头正抢占普通人办公市场。

新智元
新闻资讯7

两个浙大学生决定只用AI生存72小|甲子光年

五源资本发起“72小AI生存挑战”,浙大学生区瀚楠、陈睿轩参与。他们在封闭房间用AI工具生存72小,先搭建Agent购得物资,后尝试用AI赚钱未成功。此活动灵感源于99年“72小网络生存测试”。

甲子光年
开源动态8

商汤SenseNova U1深度拆解,原生统一架构终结缝合

文章深度拆解商汤科技开源的新一代模型「日日新 SenseNova U1」,介绍其基于 NEO - Unify 原生统一架构,在数据、训练与推理深度协同,多维度测试成绩亮眼,代表多模态从拼接走向原生建模新方向。

机器之心
开源动态8

多模型共享 GPU 内存,Berkeley 开源新工具

GPU内存利用率低是大模型部署痛点,伯克利Sky Computing Lab团队开源kvcached工具,通过虚拟化技术让多模型共享显存。它引入虚拟内存概念,按需分配,测试显示能提升效率,安装简单、兼容性好。

AI工程化
开源动态7

任何错误只犯一次:TencentDB Agent Memory 的团队记忆实践

文章聚焦 TencentDB Agent Memory 的团队记忆实践,从组织协作现状出发,阐述其原理、结构、构建方法,通过多方面测试验证其价值,提炼出设计原则,指出其核心是治理系统,目标是提升协作带宽。

腾讯技术工程
推荐文章7

小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗

微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。

AIGC开放社区