验证闭环」共找到 1099 篇相关文章

新闻资讯7

什么!ChatGPT也要刷脸实名认证了?

OpenAI和Anthropic两大AI巨头同时推进身份验证。OpenAI此前已上线年龄预测模型,对开发者和消费端用户进行身份验证;Anthropic 7月8日起更新隐私政策引入身份验证。匿名使用AI的时代或结束。

新智元
算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
推荐文章7

架构师困境:选择已被验证的道路,还是自行开辟一条新路?

开发软件时,团队要做产品功能和架构决策,面临选已验证路径还是自辟新路的困境。使用平台和框架虽能加快开发,但有副作用。团队需通过实验判断何时扩展或替换平台。

InfoQ
产品应用8

AI真能搞钱了!这家公司把大模型玩成闭环赚钱机器

当全行业还在卷大模型参数、烧算力时,零犀科技走出不同路。其自研因果大模型,用AI智能体帮企业提升销售。2025年已实现规模盈利,成为最早跑通商业闭环的大模型应用公司。

量子位
算法论文8

端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程

南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。

量子位
8

快手AgentX:推荐系统开始自我迭代

过去十年推荐系统核心在‘建模’与‘工程’,但日常迭代瓶颈在研发生产方式。快手 AgentX 团队提出 Agent 驱动研发闭环,在快手 App 业务部署中跑通完整闭环,提升效率与业务收益。

机器之心
开源动态8

如何实现可验证的Agentic Workflow?MermaidFlow开启安全、稳健的智能体流程新范式

随着大语言模型发展,多智能体系统成新前沿,「Agentic Workflow」受关注。但现有系统存在合理性难保证等问题。新加坡和南洋理工团队推出MermaidFlow,以Mermaid语言显式建模工作流,提升可解释性与可控性,实验性能优秀。

机器之心
算法论文8

LLM规划能力飙升79%!Google:内在自我批评技术拿下多项SOTA

Google DeepMind研究《通过内在自我批评提升大语言模型的规划能力》,不借助外部验证器,让LLM反复“自评+重写”,使Blocksworld准确率从49.8%升至89.3%,还介绍了方法及跨模型验证情况。

PaperAgent
算法论文8

刚刚!UCLA杨林团队证明:仅凭提示词,Gemini 2.5 Pro就可以拿到IMO2025金牌

加州大学洛杉矶分校杨林和黄溢辰撰写论文,阐述利用Gemini 2.5 Pro解决2025年IMO竞赛5道题达金牌水平。设计解题者和验证者构成的自我验证流水线,用双提示词系统迭代,还规避数据污染问题。

AI寒武纪
推荐文章7

MiniMax 怎么做 Agent:Model-Harness 协同只是第一步,还有 Inference-Harness 协同

本文介绍了 MiniMax 在 Agent 层面的实践。从内部飞书 bot 起步,发展成桌面应用 MiniMax Code,形成训练 - 服务闭环。还阐述 Agent 对模型优化迭代的作用、自研 Agent 优势,指出 AGI 是闭环递归自我改进系统。

Founder Park