「验证流程」共找到 1535 篇相关文章
Agent 看板门禁:构建 Agent Team 的 Harness 工程防御体系
文章以 Routa 看板项目卡为例,阐述 Agent Team 的 Harness 工程防御体系。指出任务完成不等于交付结束,强调 Gate First 理念,即先确认可验证状态再推进协作,还提及运行时边界等重要概念。
告别随机性:Thinking Machines Lab如何实现了LLM推理的完全确定性?
文章指出LLM推理非确定性根源并非GPU并发和浮点非结合性,而是批大小变化致核函数非不变性。作者提出实现批不变操作的策略,实验验证有效,还阐述其对训练、系统可靠性等方面的意义。
开源屠刀!400美元炼成「代码副脑」,硅谷天价模型成废铁
AI2开源Open Coding Agents,以最低数百美元算力成本,能训练贴合私有代码库的专属编程智能体。SERA-32B表现惊艳,其软验证生成技术降低成本,新代码易部署且兼容Claude Code。
10 万 Star 的反常识:AI 写代码的瓶颈从来不是代码本身
GitHub上的Superpowers开源项目,半年攒10.9万Star。它是AI编程工具的工作流操作系统,让AI像工程师工作,有面试需求、细化计划等流程,内置14个技能,安装简单,理念超前但也有局限。
物理学家靠生物揭开AI创造力来源:起因竟是“技术缺陷”
两位物理学家以生物系统自我组装过程为参考,提出并验证假设:扩散模型去噪过程类似细胞分化重组,AI的‘创造力’是模型架构直接且必然的结果,本质是确定性过程。
网页智能体新突破!引入协同进化世界模型,腾讯AI Lab提出新框架
腾讯AI Lab提出WebEvolver框架,引入协同进化的世界模型,让智能体在真实网页环境中性能提升10%,突破现有基于LLM的网页智能体瓶颈,还通过实验验证了其有效性和对网页状态变化的预测能力。
单卡即可微调大模型!内存占用仅1/8,性能依然拉满 | ICML 2025
基础大模型应用于下游任务时微调成本高,低秩适应(LoRA)方法虽降低成本,但性能不及全量微调。华中科技大学和香港中文大学团队提出GOAT框架,在25个多领域任务验证效果好,内存占用仅1/8。
Huashu-Excel正式发布!可能、也许、大概是最好用的Excel数据处理和分析skill
花叔开源Huashu - Excel,它能处理Excel或CSV,按八步流程工作,有体检、对账、质控特色。经十份真实数据压测效果好,其设计激发大模型能力、避开缺陷,几乎所有agent都能用。
5w颗星!前Google工程师为Agent打造的设计系统
Anthropic的frontend - design是Claude首个广泛使用设计技能,Impeccable由此起步并扩充功能。它有一次设置流程、23条命令、59条确定性检测规则等,还给出反模式,介绍多种安装方式及使用方法。
让大模型自己写代码、自己进化,GIM和港大这篇ACL主会,把量化因子挖掘重做了一遍
香港大学和GIM提出CogAlpha框架,将Alpha从‘公式’升级为‘代码’,搭建7层21个智能体探索体系,让大模型参与研究流程。在5个数据集上跑赢21个基线方法,还具可解释性。