「浏览器记忆」共找到 704 篇相关文章
从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench
港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。
1.9K Star!给 DeepSeek Harness 装上侧边工作台,文件、终端、Git、浏览器、插件一屏搞定!
DeepSeek Harness 是 AI Agent 运行框架,自由度高但默认 Web UI 操作不便。社区插件 DSH - better - sidebar 迅速出圈,装了侧边工作台,整合多样工具,更新勤,适合折腾 DSH 的人。
当 Agent 尝试接管浏览器,连“我是人类”都证明不了?上海交大开源发布交互评测基准 HLL
随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。
Trae-Agent 刚刚开源,Windows-MCP 操作你的电脑,Chrome MCP 让AI自动化完成浏览器任务。
Trae - Agent 开源,可完成软件工程任务。Windows - MCP 能让 AI 操作 Windows 系统,Chrome MCP Server 使 Chrome 成 AI 助理。还介绍了 Gemini Cli、Claude 等工具及特点。
YC CEO把自己第二大脑系统开源了:专供OpenClaw与Hermes,全息记忆打造迷你AGI
YC总裁Garry Tan开源第二大脑系统GBrain,可让AI agent拥有持续成长的知识库。它将各类信息汇入可检索知识库,每轮对话让agent更聪明,适用于OpenClaw和Hermes Agent,有多种使用路径。
把20多种工具塞进一个搜索框!亲测「Agentic Search」后,我关掉了几十个浏览器标签页
秘塔AI推出Agentic Search,是“边想边搜,边搜边做”新搜索方式,能自主完成多步工具调用。作者测试其为AI笔记应用策划预热活动等场景,还测市场分析、编程学习、新媒体运营场景,虽有不足但未来可期。
看似无害的提问,也能偷走RAG系统的记忆——IKEA:隐蔽高效的数据提取攻击新范式
研究聚焦RAG系统,提出全新黑盒攻击方法IKEA。它不依赖异常指令,通过自然查询提取私有信息。经多数据集测试,其效率和成功率高,还证实提取知识实用,揭示RAG系统潜在脆弱性。
最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代
人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。
小米双模型正式开源!MiMo-V2.5-Pro无中断肝出“macOS”:54个应用全开、浏览器真能冲浪
小米MiMo-V2.5系列模型正式开源,权重全量开放。该系列含四大模型,综合实力对标国际顶尖水准。MiMo-V2.5 Pro能力出色,如4小时无中断完成“macOS”系统,且Token效率高省成本。小米还推出开发者扶持计划。
一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事化视频生成
新加坡管理大学等提出开源全能多智能体框架UniVA,可统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。