「验证闭环」共找到 1099 篇相关文章
什么!ChatGPT也要刷脸实名认证了?
OpenAI和Anthropic两大AI巨头同时推进身份验证。OpenAI此前已上线年龄预测模型,对开发者和消费端用户进行身份验证;Anthropic 7月8日起更新隐私政策引入身份验证。匿名使用AI的时代或结束。
多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26
多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。
架构师困境:选择已被验证的道路,还是自行开辟一条新路?
开发软件时,团队要做产品功能和架构决策,面临选已验证路径还是自辟新路的困境。使用平台和框架虽能加快开发,但有副作用。团队需通过实验判断何时扩展或替换平台。
AI真能搞钱了!这家公司把大模型玩成闭环赚钱机器
当全行业还在卷大模型参数、烧算力时,零犀科技走出不同路。其自研因果大模型,用AI智能体帮企业提升销售。2025年已实现规模盈利,成为最早跑通商业闭环的大模型应用公司。
端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程
南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。
快手AgentX:推荐系统开始自我迭代
过去十年推荐系统核心在‘建模’与‘工程’,但日常迭代瓶颈在研发生产方式。快手 AgentX 团队提出 Agent 驱动研发闭环,在快手 App 业务部署中跑通完整闭环,提升效率与业务收益。
如何实现可验证的Agentic Workflow?MermaidFlow开启安全、稳健的智能体流程新范式
随着大语言模型发展,多智能体系统成新前沿,「Agentic Workflow」受关注。但现有系统存在合理性难保证等问题。新加坡和南洋理工团队推出MermaidFlow,以Mermaid语言显式建模工作流,提升可解释性与可控性,实验性能优秀。
LLM规划能力飙升79%!Google:内在自我批评技术拿下多项SOTA
Google DeepMind研究《通过内在自我批评提升大语言模型的规划能力》,不借助外部验证器,让LLM反复“自评+重写”,使Blocksworld准确率从49.8%升至89.3%,还介绍了方法及跨模型验证情况。
刚刚!UCLA杨林团队证明:仅凭提示词,Gemini 2.5 Pro就可以拿到IMO2025金牌
加州大学洛杉矶分校杨林和黄溢辰撰写论文,阐述利用Gemini 2.5 Pro解决2025年IMO竞赛5道题达金牌水平。设计解题者和验证者构成的自我验证流水线,用双提示词系统迭代,还规避数据污染问题。
MiniMax 怎么做 Agent:Model-Harness 协同只是第一步,还有 Inference-Harness 协同
本文介绍了 MiniMax 在 Agent 层面的实践。从内部飞书 bot 起步,发展成桌面应用 MiniMax Code,形成训练 - 服务闭环。还阐述 Agent 对模型优化迭代的作用、自研 Agent 优势,指出 AGI 是闭环递归自我改进系统。