「RSI循环」共找到 177 篇相关文章
我觉得“Agent”这个词,现在终于有了一个大家都认可的定义了
作者Simon Willison认为现在‘Agent’有了大家认可的定义,即一个AI Agent是为实现目标循环调用工具的大语言模型。还分析了此前难统一定义的情况、‘工具循环实现目标’含义,指出不同人群对‘Agent’理解有偏差。
Claude Code 究竟牛在哪里?(以及如何在你的 AI 智能体中复刻它的魔法!)
文章介绍Claude Code是出色的AI智能体,比Cursor等好用。它设计简单,提示词和工具弥补模型缺点。作者基于使用经验,给出打造类似智能体的要点,包括控制循环、提示词、工具和可引导性等方面。
突发!Gemini 3.8登顶,谷歌迈出RSI一大步
谷歌发布Gemini 3.8 Flash及专攻网络安全的3.8 Flash Cyber。前者性价比高,在多项测试逼近顶级模型;后者在网络安全测试屠榜。但谷歌也被指提前庆祝,且模型可能有‘刷榜’成分。
谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步
谷歌发布Gemini 3.8 Flash,编码能力提升,在LMArena榜单险胜DeepSeek-V4-Pro,定价与3.7 Flash一致。其输出速度快,但有网友质疑是刷分。此外还有3.8 Flash Cyber,网络安全能力强却不公开发布。
OpenAI:人&AI对齐技术应该是一个动态、双向的循环
在NeurIPS 2025上,NYU&OpenAI就Human - AI Alignment发布Tutorial。指出当前对齐像打地鼠,根源是将其当成静态、单向的,提出HAA框架,强调多元目标、人类全链路话语权及社会 - 技术系统量化监督。
微软:DeepSeek-R1等推理模型循环的原因找到了
前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。
让 Claude 自己循环干到完成——Ralph Loop 原理与实战指南
文章介绍了Ralph Loop技术,它由程序员Geoffrey Huntley发明,核心是让AI持续工作直到外部验证通过。对比了与主流Agent框架的差异,还列举其真实战绩、使用方法及适用场景。
当大模型陷入幻觉循环,如何用工程化给它“立规矩”?
普林斯顿和伯克利研究定义“机器胡扯”,指出大模型胡扯问题。蚂蚁集团旗下蚂蚁密算在2025 WAIC提出高阶程序(HOP)框架,为大模型注入规则,还开源此框架,其在多行业场景应用效果良好。
最窒息的Bug:Agent循环搜索原地打转?SGR Agent用「双阶段认知」破局
Hybrid Schema - Guided Reasoning(SGR)是革命性AI研究智能体框架,用「两阶段推理 - 执行架构」和「持久化上下文记忆系统」,解决AI助手复杂研究任务的三大痛点,模拟人类研究过程,适用于多场景。
闭源RSI的严父来了:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5
开源AI基础设施公司Prime Intellect研究表明,借助多智能体Harness,让开源模型负责监控和实现,可让‘AI开发AI’更便宜、效果更好。实验中,Kimi K3搭配Harness逼近Opus 5。