「多智能体平台」共找到 7228 篇相关文章

算法论文7

大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
新闻资讯7

AI裁员这一刀,终于砍到他们身上!外媒高层一锅端,9年老记者血泪控诉

宣扬「AI变革」的外媒Business Insider宣布裁员21%,全面拥抱AI。此前多名记者被裁,引发读者不满。今年谷歌、微软等大厂也有因AI而裁员情况,有预言称其将致入门级白领岗位消失,企业也想借其淘汰员工。

新智元
产品应用8

拆解 WorkBuddy、千问办公和豆包工作,它们其实不是同一种产品

本文作者用真实职场脏活测试腾讯WorkBuddy、阿里千问办公、字节豆包工作三款办公Agent,对比三者产品路线、执行结果和执行环境差异,揭示当前办公Agent的发展现状与局限。

AI科技评论
新闻资讯8

人类最后考试已不够用,Agent最后考试来了!

AI飞速进步,人类最后考试(HLE)已不够用,伯克利牵头推出智能体最后的考试(ALE)。ALE真实、全面、可验证,当前最强AI在最难档通过率仅8.6%,主流系统平均2.6%,显示AI距替人干活尚远。

AIGC开放社区
产品应用8

一个人+Claude+云服务,相当于一整个工程团队

网上两个实操演示被疯转,一是Google Cloud工程师用Claude配合Google云部署应用;二是Anthropic Claude团队教搭建带持久记忆的AI智能体。博主整理7天实操计划,将Claude变“全自动AI雇员”,还介绍多种AI雇员类型及成本。

AI工程化
新闻资讯7

当国产模型追上闭源旗舰,企业 AI 编程的真正障碍才浮出水面

过去企业AI Coding讨论多集中在模型能力等方面,DeepSeek V4出现缓解了模型问题,但更深层的代码库业务隐知识等问题浮现。合规限制使企业工具建设受阻,V4打破了模型供应瓶颈,可组织知识管理仍成难题。

InfoQ
新闻资讯8

GTC 巅峰对话 Jeff Dean x Bill Dally:预训练范式已死、延迟瓶颈不在计算、谈透 AI 五年未来 | GTC 2026

GTC 2026上,NVIDIA首席科学家Bill Dally和Google Jeff Dean展开重磅对话。讨论了模型能力进步、低延迟推理架构、模型自主进化、数据与算力、训练与推理硬件差别等多方面内容,分享对未来AI的看法与见解。

AI科技大本营
新闻资讯8

Google 悄悄升级了 Deep Think,ARC-AGI-2 直接干到 84.6%

Google DeepMind 升级了 Gemini 3 的专用推理模式 Deep Think,跑分屠榜。ARC - AGI - 2 拿下 84.6%,在多个基准测试中表现优异。它不仅是解题机器,还能解决真实科学工程问题,已向部分用户推送,科研人员和开发者可通过 API 使用。

AGI Hunt
新闻资讯7

美国模型长期霸榜的LMArena,出现了一个国产模型

2025 年底,中美 AI 阵营发展路径有区分,美国多是强模型加工具链,中国在多方面发力。12 月 23 日 LMArena 更新文本榜,百度文心新模型 ERNIE - 5.0 - Preview - 1203 以 1451 分登上榜单,成中国第一且是前 20 名里唯一非美国模型。

MacTalk
产品应用7

互联网黑话之西游记版 AI 视频的制作方法

文章介绍互联网黑话之西游记版AI视频制作方法。先与AI共创剧本,以互联网黑话结合西游记场景为佳;再让AI根据剧本和人物形象图生成包含多内容的分镜脚本,生成首帧图后按脚本制作视频,不满意可反复生成再拼接。

宝玉AI