「开源智能体」共找到 5699 篇相关文章
AgentAuditor: 让智能体安全评估器的精确度达到人类水平
LLM智能体进化为“行动派”,但自主权带来安全问题。现有评估基准缺乏有效精准评估器,研究者推出AgentAuditor框架及ASSEBench基准,让LLM评估器精确度达人类水平,为构建可靠智能体提供工具。
谷歌发布智能体Scaling Law:180组实验打破传统炼金术
谷歌新论文通过180组实验找到智能体的Scaling Law(定量扩展原则),在四个基准测试评估,推导预测模型,实验结果颠覆直觉,还量化阻碍因素,发现不同模型协作性格,为智能体部署决策提供支撑。
收手吧GPT-5-Codex,外面全是AI编程智能体!
OpenAI推出专为智能体编程设计的GPT-5-Codex,其在代码重构、审查和缺陷发现上表现提升,具动态资源分配机制。文中还提及Codex起源、Harness概念及OpenAI内部工具,当前编程智能体竞争激烈。
SafeHarness:告别防御盲区,为智能体Harness穿上「全生命周期安全护甲」
在自主AI智能体生态中,Harness是核心组件却易成攻击目标。中国科学院信息工程研究所等推出SafeHarness框架,将防御机制融入智能体Harness运行生命周期,解决现有安全工具缺陷,实现系统级协同防御。
AI 智能体界的 npm 来了!Vercel 推出 Skills.sh,欲统一智能体指令集
Vercel 发布开源项目 Skills.sh,为 AI 智能体打造“标准动作库”,让其通过命令行执行可复用操作。它是开放生态,开发者能定义、分享指令。项目获广泛关注,社区认为其实用性强。
I/O大会开完,谷歌连搜索框都变智能体了
当地时间周二谷歌I/O大会举行,转型智能体时代。谷歌推出Gemini 3.5系列模型,轻量级3.5 Flash已开放,重量级3.5 Pro仍在开发。还发布全新AI智能体Spark,改造谷歌搜索,推出多模态模型Gemini Omni。
《2026 OpenClaw 类自主智能体发展白皮书》正式发布 | 中科算网算泥社区
5月20日,中科算网算泥社区发布《2026 OpenClaw类自主智能体发展白皮书》,阐述从“对话式AI”到“代理式AI”的转变。介绍OpenClaw类自主智能体定义、技术剖面、关键能力及系统架构,为从业者提供参考。
全国首部AI智能体应用评估标准,现公开征集起草单位和个人
2025年成AI智能体元年,国务院提出目标,市场规模爆发增长。但企业部署面临“效能黑箱”,智合标准中心发起《企业级AI智能体应用效能评估规范》团体标准起草,现公开征集起草单位和个人。
DeepAgent:能够自主找工具的深度思考智能体,工具&任务随心配
现有智能体框架自主性差、工具使用受限。中国人民大学等机构研究者提出DeepAgent,能自主思考、发现工具并执行动作。它在多基准测试中表现出色,为构建更强真实世界智能体迈进重要一步。
具身智能大脑+首个SaaS开源框架,智源研究院刷新10项测评基准,加速群体智能新范式
智源研究院推出通用具身大脑RoboBrain 2.0与全球首个具身智能SaaS开源框架RoboOS 2.0并全部开源。前者突破主流AI模型瓶颈,后者实现大脑云端优化与小脑技能免适配注册,降低开发门槛。