「合成持续训练」共找到 2622 篇相关文章
让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务
手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。
Codex 负责人:「所有人都是 builder」是个很糟糕的主意
OpenAI Codex 团队负责人 Andrew Ambrosino 认为,AI 时代产品开发各环节发生变化,实现成本降低,品味变得更重要。他还谈到岗位角色融合但 PM 不会消失,以及 Codex 发布时机和工作模式等问题。
邢波再出手:上次「骂」完世界模型,这次轮到智能体了
邢波教授新作《智能体模型批评》上线 arXiv,质疑当下被称为「智能体」的系统是否名副其实。论文将其分为两类,沿五维度拆解主流设计,提出 GIC 架构,还探讨了安全问题,指出要让能力内化进模型。
翁荔最新博文深度拆解Scaling Laws:AI行业最信赖的公式,没有那么可靠
6月24日,前OpenAI安全研究副总裁翁荔在博客发表长文,对缩放定律进行系统梳理,指出该理论在实际拟合和外推过程有易被忽视的陷阱,还讨论了数据有限时定律是否成立等问题。
你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布
文章指出Harness工作流常靠‘主观vibes’驱动,缺乏有效评价体系。为此推出Harness Eval评测系统,包含出题、答题、改卷等环节,形成闭环,帮助工作流持续改进,还能提升整体通过率。
编程新王Composer 2.5来了,逼近Opus 4.7!成本仅为1/10
Cursor推出全新AI编程模型Composer 2.5,在部分编程基准测试上接近Claude 4.7 Opus和GPT - 5.5,运行效率最高提升10倍,成本仅为竞品一小部分。其采用定向文本反馈RL等机制,还与SpaceXAI合作冲击百万H100集群算力。
WWW'26 | 跨任务自适应的Multi-Agent协作新范式
大型语言模型驱动的多智能体系统成解决复杂任务重要范式,但智能体协作存在关键问题。Griffith和西北农林科技大学团队提出OFA - MAS,将多智能体拓扑设计从one - for - one推向one - for - all,实验效果佳。
GPT-5.6现身后,下一个Claude Sonnet 4.8又曝光了!
GPT-5.5发布不久,开发者在Codex内部日志发现GPT-5.6,几乎同时,Anthropic的Claude Code源码泄露,炸出Sonnet 4.8、Jupiter等型号。两家公司下一代模型几乎同时曝光,模型迭代节奏在加速。
坪山芯链通!坪山区半导体与集成电路公共服务平台联动发展活动圆满举办
4月28日,坪山区半导体与集成电路公共服务平台联动发展活动举办。活动通过平台揭牌、演讲、参观等环节,搭建政企学研资协同平台。六大平台展示成果与能力,活动打通平台与企业沟通渠道,助力产业发展。
一种可以减少 CI 回归测试套件规模的更佳方案
作者作为测试架构师,认为减少CI回归测试套件规模理论诱人但实践常失望。介绍有效处理大型测试套件的方案,如随机趋势分析、多上下文模式匹配等,还谈及无门控测试等优势,能助力管理测试集。