「失败状态」共找到 333 篇相关文章
浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
浙江大学ReLER团队开源的PhyEdit,用3D foundation model明确目标几何,让DiT图像编辑器负责最终渲染。单张图片里物体能移动并形成连续状态,在多项指标表现出色,还具备多种能力,已被ACM MM 2026接收。
北大2篇Skill炸场,Agent彻底进化
北京大学连发两篇论文,给出让 Agent 变强的答案:让 Skill 自己进化。`SESA` 针对工具增强的搜索问答,用四个阶段闭环使任务生成和技能记忆一起进化;`VeriSkill` 把验证器废信号变成可信更新,二者场景不同但核心一致。
Agent 跑分追平 Codex、成本低至 1.95 美元,这家中国公司做到了
德勤报告显示86%多Agent项目落地失败,硅谷也出现‘无限智能体死循环’。EvoMap团队的EvoX采用‘蜂群式自进化’打法,系统容错率翻倍、完成率跃升,成本大幅降低。跑分追平Codex,还展现出自组织潜力。
挺意外的,Agent长期记忆潜力被AMemGym挖出来了
论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
人才济济的大厂,为何频频产出垃圾代码?
科技大厂常产出垃圾代码,原因在于多数代码变更由菜鸟工程师完成,他们经验不足且常处于摸索状态。老手虽有优势,但过度依赖有问题。大厂为调度人才牺牲代码质量,这在AI时代隐患更大。
离谱:打造超10亿美元的独角兽,从真人假扮成AI开始
2017年两位创业者多次失败后,决定做自动记录会议笔记的AI助手,却无AI技术,便真人假扮。这种模式竟让他们赚到钱后开启自动化。如今Fireflies.ai估值超10亿美元,但早期做法引隐私等争议。
用于评估AI Web渗透测试能力的工具:XBow Bechmark,比靶机更好
文章介绍了用于评估AI Web渗透测试能力的XBow Benchmark,它已在github开源。该基准含104个Web安全挑战,涵盖多种漏洞,设计确保可重复性和状态持久性,其评估能力获广泛认可,还介绍了开源内容等。
Sutton判定「LLM是死胡同」后,新访谈揭示AI困境
强化学习之父Rich Sutton直言LLM是死胡同,因其无法从持续实际互动中学习,违背他坚持的原则。在新访谈和圆桌讨论中,多位专家碰撞观点,探讨AI研究问题、强化学习困境及LLM发展走向等。
Subagents:构建高可靠 AI Coding 专家顾问团
文章探讨 Claude Code 的 Subagents 功能在复杂 AI 编程场景的价值与实践。指出复杂 AI Coding 面临上下文膨胀等问题,而 Subagents 可创建专属子代理,有 Context 保护等优点,还介绍使用方法、业务实践及相关思考。