「自主纠错」共找到 580 篇相关文章
Claude Sonnet 4.5被炸出来了,依旧最强编程,连续30小时自主运行写代码
新发布的Claude Sonnet 4.5在SWE - bench等多项测试中成绩提升,能连续30小时自主写代码,还改善了对齐和安全性指标,且提质不加价。此外,Anthropic官宣Claude Agent SDK,发布Imagine with Claude功能。
AI操作有了“紧急刹车”!通义&自动化所AI决策诊断模型,GUI智能体纠错正确率SOTA
阿里通义实验室与中科院自动化所推出GUI - Critic - R1模型,能在GUI智能体操作执行前诊断决策,避免错误。介绍了其动机、方法、数据集及实验,证明该模型在生成判断和提建议方面有效。
阿里 Qwen3.8 正式发布:2.4T 规模,自主编程 16 天搓出一个 Hermes Agent
8月3日,阿里发布新一代基座大模型Qwen3.8,总参数量2.4万亿,编程和办公能力提升,在权威榜单中表现出色。其API已上线,价格有优势。‘千问办公’公测,Qwen3.8性能强大,还适配阿里真武M890超节点。
开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具
Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。
PPIO姚欣:AI正在进入自主行动与创造时代,智能体需要全新的操作系统|MEET2026
在量子位MEET2026智能未来大会上,PPIO姚欣表示AI进入自主行动与创造时代,Agent会成未来AI主力,Agent Infra将成新操作系统。PPIO构建AI云能力,还推出Agent沙箱助力厂商落地。
一个省略号提示+强化学习搞定大模型“过度思考”,中科院自动化所新方法:从强制推理到自主选择
中国科学院自动化研究所联合鹏城实验室提出AutoThink方法,用省略号提示和多阶段强化学习,让推理大模型依题目难度自主切换思考模式,解决过度思考问题,在多数据集验证有效。
168小时AI狂写300万行代码造出浏览器!Cursor公开数百个智能体自主协作方案
Cursor创始人公布实验结果,让数百个AI智能体跑一周,从零造出可用Web浏览器,产出超300万行代码,项目源码已公开。此次实验靠GPT - 5.2 - Codex,还设计了智能体协作架构,引发业界讨论。
ACL 2025 | 让小说角色 「活」起来!复旦BookWorld打造沉浸式小说世界模拟系统
复旦大学团队主导的BookWorld系统,是ACL 2025论文成果。它能从小说提取数据构建AI世界,让角色AI互动创作故事。系统有自主和干预模式,实验表现出色,未来可成互动娱乐平台。
抄作业了!让AI产品告别“上线就崩”的CC/CD框架,6步搞定,拿走不谢。
文章指出AI产品因大模型不确定性,易上线翻车。介绍海外流行的CC/CD开发框架,阐述AI产品不确定性原因,强调自主与控制平衡,还给出该框架落地的6步工作流。
Spring AI Alibaba实践|后台定时Agent
文章参考Langchain,探讨Agent新运行形态,Spring AI Alibaba(SAA)为开发提供框架。介绍自主运行Agent优势、适用场景,说明构建方法,还给出店铺经营分析和评价舆情分析两个实践案例代码。