「自动化闭环」共找到 788 篇相关文章
中山大学&华为联合提出 Issue Resolution 数据集构建神器SWE-Factory:每条只要$0.024
中山大学和华为联合提出低成本开源方案 SWE-Factory,可自动收集代码打造高质量代码评估数据集。它能解决传统构建流程繁琐、依赖人工的问题,实现全流程自动化,还构建了 SweSetupBench 数据集,表现出色。
星海图高继扬:具身智能下半场,应用为王
星海图CEO高继扬在AGI Playground大会分享具身智能观点,认为2026年是下半场,核心是应用。具身智能发展慢因缺高质量数据和合适本体,未来产品形态或为‘整机+预训练模型+后训练工具’,下游将形成大生态。
揭秘大模型评测:如何用“说明书”式方法实现业务场景下的精准评估
文章系统性介绍业务场景下大模型评测流程,包括需求分析、评测集设计生成、维度设定、任务执行和报告输出。指出评测挑战,如设计维度和集,还给出评测方法及案例,像蚂蚁评测集、业务自动化评测。
西湖 & 浙大 | PiFlow:让AI拥有“科学直觉”,Agent用于科学发现的新范式!
西湖大学团队提出PiFlow,一个基于信息论的自动化科学发现框架。它将科学发现视为结构化的不确定性降低过程,由科学原理指导,通过Min - Max优化机制平衡探索与利用,在多领域实验中效果显著,应用前景广。
证明也有「选择困难症」?腾讯AI Lab与大模型研究部联手打造 MPS-Prover ,多视角破解形式化推理瓶颈!
本文聚焦逐步式自动化定理证明器困境,腾讯AI Lab等提出MPS - Prover。它有数据筛选和多视角树搜索两项创新,提升搜索效率和证明质量,在多基准表现佳,还解决六道IMO难题。
4K Star的多人 Agent 协作平台 Multica!Agent即队友,可像同事一样被指派、被追踪!
当前多 Agent 协同缺乏统一管理和经验沉淀,GitHub 开源的 Multica 平台解决了这一问题。它把编码 Agent 变成队友,自动化处理任务,支持多 Agent 后端,有多种功能特性,提供云服务和自托管两种使用方式。
一行命令,让任何软件秒变AI神器!这个GitHub项目杀疯了
AI智能体推理强但使用专业软件能力差,现有解决方案不佳。CLI - Anything自动化框架打破困境,能让AI通过命令行控制软件,为13款软件生成CLI,有7阶段流水线,多场景适用,介绍了使用方法和项目地址。
Agentic RL训练:它不是单一 RL 算 法,而是一整套环境建模、学习信号、异步数据流、策略优化和基础设施的协同系统
文章指出Agentic RL训练不是单一算法,而是协同系统。它与传统RL不同,有四个训练变化。理解它要围绕三个不变量,还从环境建模等八个方面阐述,强调其竞争在于环境、信号、分布与系统的协同闭环。
大模型微调评测入门:看懂这些指标,才知道模型好不好
文章指出大模型微调中很多新手重“调”轻“评”,评测是决定模型落地的关键。介绍分类和生成任务评测指标,给出实操步骤,还说明如何综合判断模型好坏,最后展望评测技术朝自动化等方向发展。
谷歌Agent正在憋大招:AI科学家内测,锦标赛制“炼”想法,一次跑40分钟
谷歌正为Gemini Enterprise开发多智能体系统,能扮演联席科学家提炼想法,实现研究自动化。工作时以锦标赛形式评估想法,一次运行约40分钟,还准备了“想法生成”“联席科学家”等智能体。此外还有“与文档对话”功能。