「思考Agent模型」共找到 9466 篇相关文章
Anthropic 最新博客:构建 AI Agent 评估体系完整指南
Anthropic 工程团队发布博客《Demystifying evals for AI agents》,揭秘内部对 AI Agent 的评估方法,涵盖评估结构、构建原因、常见 Agent 类型评估技术、评估非确定性处理、构建路线图及与其他方法配合策略等。
大模型是不是到顶了?瓶颈到底在哪
文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。
Anthropic重磅研究:250份文档就能 “搞垮” 大模型?
Anthropic等团队发布研究,进行大规模投毒攻击模拟。结论是投毒大模型所需‘毒药’数量与模型大小和干净数据量无关,取决于投毒文档绝对数量,250份就能‘搞垮’模型,改变了对AI安全的认知。
大模型IMO25数学竞赛成绩公布了
大模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。测试由MathArena组织,采用统一环境和双人匿名评估。还介绍了测试模型、题目及模型表现,人类版结果预计本周六发布。
一粒「扣子」,开启了Agent的全生命周期进化
2025年被视为Agent爆发元年,自年初通用Agent产品Manus出现后,其受关注程度空前。火山引擎Force 2025大会上,升级后的扣子成焦点,它从开发平台进化为全生命周期平台,覆盖开发、框架、调优、协作四大部分。
《AI大模型与异构算力融合技术白皮书》10月10日发布
算泥社区《AI大模型与异构算力融合技术白皮书》10月10日14:00线上发布。AI大模型爆发使算力需求激增,异构算力成刚需。国内外政策与产业驱动其发展,该白皮书能为开发者提供实用技术参考。
神秘模型「Pony Alpha」火了,被曝是GLM-5
OpenRouter上线神秘模型“Pony Alpha”,引发网友竞猜。该模型主打编码等,有高工具调用准确率。网友实测其前端能力惊艳。多项证据指向它可能是GLM - 5,春节档多家国产大模型将轮番上阵。
混元 Hy3 发布:99% 的任务,够用了
腾讯混元模型 Hy3 正式上线,免费使用两周。它是快慢思考融合的 MoE 模型,主打 Coding 和 Agent 场景,性价比高。作者用它做了多项测试,如制作 PPT、开发代码、舆情分析等,还与 GLM - 5.1 对决,表现不错。
刚刚,Kimi K3开源!3万亿模型权重全球开放
2026年7月27日,Moonshot AI开源全球首个3万亿参数级模型Kimi K3。它不仅参数量大,还在多领域表现出色,能与顶尖闭源模型媲美。其架构创新、训练独特、推理成本低,有望改变全球大模型格局。
从答题到做实验:SciAgentGym让大模型进入科学工作流
复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。