「子任务级可验证性」共找到 2784 篇相关文章
豆包 2.1 Pro:属于普通人的代码能力
作者分享用AI写代码的经历,指出豆包2.1 Pro强化Coding Agent端到端交付能力,成本低。还展示用它做的多个案例,如歇后语扭蛋机、文件整理工具等,认为其能解决日常问题,降低Coding门槛。
比 Playwright 更给力,这个新开源的项目6啊~
GitHub上的BrowserAct项目是面向AI Agent的浏览器自动化CLI,是为AI Agent设计的真实浏览器执行层。它有三层反检测突破体系、三种浏览器模式等功能,能解决Agent操作浏览器的诸多问题,适合多场景。
19年不丢数据,擦写6万次不坏,原子级材料重新定义未来芯片
上海大学王震宇副教授团队在《自然·电子学》发文,用二硫化铌和二硫化钼做出新型非易失存储器,能保持数据约19年、擦写超6万次,还具备计算和存储两种本领,对未来低功耗计算和存内计算有吸引力。
一文搞懂如何在Codex中使用goals
OpenAI文章介绍Codex中Goals的使用,包括定义、使用方法、与普通prompt区别、编写要点、激活后变化、内部设计等,还给出复现论文示例,指出适用与不适用场景,称其改变Codex运作模式。
别再错过啦,AI Agent记忆革命:95.2%检索率的持久记忆系统深度解析
agentmemory是为AI编码Agent打造的持久记忆系统,能自动捕获操作上下文,有三层搜索与四层记忆架构。支持12+种主流AI Agent,有全平台覆盖、零外部依赖等优势,虽有局限但值得开发者一试。
Skills驱动推理新范式,清华&北大:Token立省59%,准确率不降反升
当前推理模型虽准确率高,但生成“思考过程”会使推理成本和延迟上升。奇元科技、清华、北大等提出TRS框架,将历史推理轨迹蒸馏成技能卡片,在推理时检索注入,实现更少Token、更高准确率。
22.4K Star!这个开源 AI 工具给 Agent 装上「项目经理大脑」!
GitHub上项目Beads登上Trending榜单,它是为AI编程助手设计的分布式任务追踪系统,底层基于Dolt数据库,解决多AI协作痛点,有版本控制、AI优化等亮点,还提供多种安装方式。
Cursor 9秒删库搞崩公司,然后…写了份检讨
美国汽车租赁SaaS公司PocketOS创始人Jer Crane用Cursor+Claude Opus 4.6处理任务时,AI Agent 9秒删光生产数据库和备份。事后AI写检讨,各方被问责,此前也有AI误删数据事件。
近期,不错的LLM Agent统一记忆框架综述~
随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据集复现比较10个方法,还设计出新的低token开销框架。
直面LeCun愿景,智在无界发布最强具身世界模型,20万小时人类视频屠榜6大榜单
智在无界作为人类视频学习路线开创者,4月14日发布第三代旗舰模型Being - H0.7,用20万小时人类视频训练,提出新范式,在6项权威评测中综合排名全球第一,拓展了世界模型能力边界。