开源动态8
上海交大开源 HLL,测 Agent 验证码处理能力
深度学习自然语言处理
AI 摘要
上海交大等团队:为评测 Agent 应对验证码能力,发布 HLL 基准。测试显示,前沿模型在动态验证中成功率暴跌,暴露出多步交互微操短板,该基准对 Agent 走向真实场景至关重要。
阅读原文 · 深度学习自然语言处理
当 Agent 尝试接管浏览器,连“我是人类”都证明不了?上海交大开源发布交互评测基准 HLL
随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态7
EvoMap:构建自进化 Agent 网络
当下 Work Agent 难以稳定完成复杂长程任务,且经验无法沉淀。EvoMap 提出自组织蜂群架构,通过 AutoResearch 落地验证,探索 AI4AI 方向,构建记忆和连接的三层产品结构,推动 Agent 网络自进化。
特工宇宙
推荐文章8
EvoMap团队给出RSI工程新解
目前行业探讨大模型的RSI时,常陷入思维定势。EvoMap团队没有盲目跟风,而是提出极具现实意义的工程新路径,构建自进化智能体,让经验在网络流转,还以硬核数据证明其体系有效性。
机器之心
开源动态8
Semantica:给Agent加知识图谱
Semantica是LLM、向量库与Agent框架下的语义/上下文层,能把碎片化企业数据变成结构化、可查询的上下文图与知识图谱。介绍了其面向对象、功能、优势、使用方法、架构等内容。
GitHubStore
开源动态8
浙大北大开源Easel,包办社媒全链路
浙江大学和北京大学联合开源Easel,这是面向社媒创作者的内容工作台,用一个Agent打通全链路,有画像驱动等六大亮点,还给出清晰的快速上手流程。
开源星探