智能体基准」共找到 4082 篇相关文章

推荐文章8

吴恩达来信:智能并行运行以提升效率

吴恩达称并行智能成扩展AI规模新方向。AI性能会随数据量、训练及推理计算量提升,但耗时久。随着LLM每个token价格下降,更多智能工作流被并行化,且相关研究增多。

DeeplearningAI
算法论文8

工行x上交大发布多智能研究成果,通过群智能刷新翻译新高度!

2025年多智能系统成大模型研发新高地。工行大数据和人工智能实验室与上海交大人工智能学院推出多智能翻译系统TACTIC,以认知翻译学为指导,在相同模型配置下提升翻译效果,在小模型下提升更明显。

深度学习自然语言处理
算法论文8

智能并非越多越好,45%准确率成关键拐点

Google研究《Towards a Science of Scaling Agent Systems》验证“智能并非越多越好”。在GPT等上实验发现,单个智能准确率超45%,增加数量会损性能,还揭示工具税、错误螺旋等问题,给出预测公式。

AI工程化
开源动态8

阿里通义开源GUI智能SOTA:2B到235B端云协同重新定义移动端GUI智能

阿里通义实验室开源MAI - UI,通过端云协同架构等解决GUI智能部署难题。它全谱系模型设计应对硬件约束,自进化数据管线和在线强化学习提升性能,端云协同平衡隐私与效率,扩展动作空间打破局限,在多基准测试创SOTA。

AIGC开放社区
新闻资讯7

金融智能真的是大模型落地“最后一公里”?

InfoQ《极客有约》X AICon 直播栏目邀请业内人士探讨金融 AI 大模型实践现状。指出大小模型融合是主要方案,智能有应用但也有问题。还分享了评估 AI 项目的要点、智能应用案例及未来布局方向。

InfoQ
算法论文8

对话 Synergy 团队:「龙虾」之后,下一代智能正演变为「互联网公民」

两年间,AI Agent能力与数量爆炸。Synergy团队认为,下一代智能应是“智能公民”,需跨过建立身份、学会协作、实现进化三道门,还探讨了其对互联网的影响及人机共处问题。

AI科技评论
新闻资讯8

收手吧GPT-5-Codex,外面全是AI编程智能

OpenAI推出专为智能编程设计的GPT-5-Codex,其在代码重构、审查和缺陷发现上表现提升,具动态资源分配机制。文中还提及Codex起源、Harness概念及OpenAI内部工具,当前编程智能竞争激烈。

新智元
新闻资讯7

多个编码智能同时使用会不会混乱?海外开发者热议

AI编程工具进步快,GPT - 5等模型推动开发自动化。编码智能成开发常态,但存在问题。独立开源开发者Simon Willison分享并行使用多个编码智能经验,引发海外开发者热议。

机器之心
开源动态8

SafeHarness:告别防御盲区,为智能Harness穿上「全生命周期安全护甲」

在自主AI智能生态中,Harness是核心组件却易成攻击目标。中国科学院信息工程研究所等推出SafeHarness框架,将防御机制融入智能Harness运行生命周期,解决现有安全工具缺陷,实现系统级协同防御。

深度学习自然语言处理
新闻资讯8

I/O大会开完,谷歌连搜索框都变智能

当地时间周二谷歌I/O大会举行,转型智能时代。谷歌推出Gemini 3.5系列模型,轻量级3.5 Flash已开放,重量级3.5 Pro仍在开发。还发布全新AI智能Spark,改造谷歌搜索,推出多模态模型Gemini Omni。

机器之心