「Claude API」共找到 1759 篇相关文章
Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66
来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。
14B检索能力超过Google Search,阿里ZeroSearch通过RL激发LLM检索推理能力~
有效信息搜索对提升LLMs推理和生成能力重要,当前RL方法有文档质量不可控和API成本高问题。阿里通义Lab提出ZEROSEARCH框架,经多步骤训练,实验显示其在检索能力和泛化性上表现出色。
刚刚,OpenAI挖来黑客「祖师爷」!
OpenAI近期动作不断,菲尔兹奖得主、翁荔之后,黑客圈“祖师爷”Halvar Flake(真名Thomas Dullien)官宣入职。他是BinDiff之父,在谷歌有诸多成果,还参与开源项目用Claude修bug,此时加入或因GPT安全事件频发。
阿里云发布为Agent而生的全新AI产品官网“千问云”,模型服务全面Skill、CLI化
5月20日,阿里云在2026阿里云峰会上发布全新AI产品官网“千问云”,提供150多款主流模型API,将模型服务核心能力封装为Skills和CLI工具,方便Agent调用,还提供便捷用量管理和多种付费模式。
2篇最新Anthropic论文,揭开LLM对齐新范式
Anthropic在5月连发两篇研究,揭示LLM对齐训练新范式。指出单纯模仿正确行为不足以保证安全,需在预训练与对齐微调间插入教原理阶段。研究围绕Claude模型展开,有多项关键发现,MSM方法效果显著。
全球第一,13个SOTA!我们找到了龙虾界掌管GUI的神
明略科技推出自研 GUI-VLA 智能体模型 Mano-P 1.0,不依赖 API 对接与浏览器场景,可操作桌面软件与网页界面。它在 13 个多模态基准榜单达 SOTA,支持本地运行,数据零上云,采用分阶段开源策略。
OpenClaw构建自我迭代AI助手笔记
作者花3天体验OpenClaw,构建银行客户经理助手场景,验证通用智能体框架可用性。介绍Agent构建、迭代、交流及评估能力构建过程,对比OpenClaw与Claude Code、OpenViking,指出记忆系统问题,肯定专属智能体提升生产力的可行性。
刚刚,智谱和华为搞波大的:中国首个国产芯片训练出的SOTA多模态模型!
智谱与华为合作开源新一代图像生成模型GLM-Image,是中国首个全程用国产芯片训练的SOTA多模态模型,擅长文字渲染,拿下多项榜单第一,API调用一张图只要0.1元,还解析了其技术架构。
OpenAI发布GPT-5.1 Codex Max,编程能力比Gemini 3更强、更持久
为换回注意力,OpenAI紧急发布GPT - 5.1 Codex Max。它在编程测试中表现优于Gemini 3 Pro,还实现24小时项目级开发。引入自动压缩与扩展推理改进,效率提升,现已多途径可用,API访问将开放。