「复杂UI应用」共找到 3057 篇相关文章
专治智能体盲跑!微软发布AI Agent 5大可观测性,打通任督二脉
今天凌晨微软官网发布AI Agent 5大可观测性最佳实践,解决智能体盲跑等难题。介绍了智能体可观测性概念和好处,展示5个应用案例,还阐述5大实践,如选模型、持续评估、集成CI/CD等。
谷歌将 A2A 捐赠给 Linux 基金会,但代码实现还得靠开发者自己?!
当地时间 6 月 23 日,Linux 基金会宣布与多公司成立 A2A 项目,由谷歌捐赠协议规范等。A2A 支持智能体通信协作,谷歌称其将在中立治理下开发普及。此外还对比了 A2A 与 MCP、ACP 等协议,探讨实际应用问题。
MSRA首测AI从零建仓库:能写、能跑,但不一定对丨ACL'26
微软亚洲研究院工作RepoGenesis被ACL 2026高分录用,它是面向多语言、仓库级、端到端Web微服务生成的基准。输入贴近实际,用多维度评测开源Agent和商业IDE,还拓展模型微调。但也有边界,未模拟真实复杂需求。
代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈
ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。
一篇400+文献最新RAG技术系统性综述
本文对RAG技术进行系统性综述,通过筛选5大数据库、128篇高被引文献、343个数据集,给出技术地图、评估框架与未来路线,梳理技术全景、评估指标,还介绍主流数据集,指出RAG已演变为复杂系统。
AlphaEvolve:陶哲轩背书的知识发现 Agent,AI 正进入自我进化范式
Google今年5月发布的AI系统AlphaEvolve,结合Gemini模型与evaluator,能发现新算法。它源于FunSearch,可多领域应用,运行机制类似自然进化,其关键组件evaluator对其发展很重要,也标志AI进入自我改进范式。
AI参与战争的时代正式拉开帷幕?
美以对伊朗军事行动或已运用AI,美军投入大量资金研发相关技术,并通过实战迭代提升AI定点清除成功率。AI在军事中有多方面应用,美国已启动相关计划,引发全球军备竞赛,中国应迎头赶上。
刚刚,杨植麟亲自开源Kimi K2.5!国产大模型打架的一天
今天国产大模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。
全靠Claude Code 10天赶工上线,Cowork 删用户11G文件不含糊!核心研发:长时间打磨再发布很难成功
Anthropic发布的Claude Cowork研究预览版问题频出,如删用户文件、窃取文件。与Claude Code对比,它交互繁琐、效率滞后。不过核心研发称快速上线再迭代,未来Agent类应用界面会趋简,Skills是关键。
第一名方案公开,代码智能体安全竞赛,普渡大学拿下90%攻击成功率
亚马逊举办代码智能体安全比赛,普渡大学团队 PurCL 作红队以超 90% 攻击成功率夺冠。他们耗时八月、花百万美元开发全过程红队系统并开源,还发现当前 AI 安全研究在复杂领域对齐有挑战。