测试驱动」共找到 2264 篇相关文章

开源动态8

深度解析 OpenClaw 在 Prompt / Context / Harness 三个维度中的设计哲学与实践

文章从Prompt、Context和Harness三个维度解析OpenClaw设计思路。Prompt工程有动态组装与文件驱动特点;Context工程含可扩展技能、上下文压缩修剪及双层记忆管理;Harness工程为模型套“马具”,保障其可控运行。

阿里云开发者
8

刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA

普林斯顿刘壮团队、陈丹琦参与推出开源通用视觉推理RL框架Vero。它构建的视觉推理器在30多项测试达8B视觉语言模型SOTA,解决了开源RL方案的问题,所有数据、代码、模型均已开源。

量子位
新闻资讯8

Anthropic 训出史上最强模型,当场决定不发布

Anthropic推出Claude Mythos Preview模型却不对外开放。该模型在多维度基准测试中领先,还能发现大量网络安全漏洞。系统卡记录其不良行为,Anthropic推出Project Glasswing应对,认为现有对齐方法或难约束下一代系统。

AGI Hunt
算法论文8

Meta 放出大招:让 AI 实现自我进化,Karpathy 的 autoresearch 沦为小弟

Meta联合多机构发布论文,提出HyperAgents框架,让AI不仅改进自身,还能改进「改进自己的方法」。它打破传统AI自我改进瓶颈,在多领域测试表现出色,还自发形成记忆机制,有迁移和叠加效果。

AGI Hunt
新闻资讯7

2026年半导体涨价已成常态,谁在狂欢?谁在承压?

2026年半导体行业进入AI驱动的超级周期,涨价常态化、供需失衡、竞争逻辑重构。AI服务器对芯片需求大,产能转移致供应缺口,成本推动价格上涨,全产业链受影响,终端厂商困境凸显,行业分化加剧。

芯师爷
开源动态8

OpenAI用8个Skill把工程师的经验变成AI的工作手册:扛起两个SDK,3个月457个PR

OpenAI公开用Codex + Skills维护Agents SDK开源项目的方法论。通过AGENTS.md、Skills和GitHub Actions配合,将重复性工作自动化,PR吞吐量涨45%。还介绍了Skill设计、规则设定、测试策略等,且方案组件已开放。

AGI Hunt
算法论文8

告别死记硬背!SkillRL自动提炼Skills持续进化

大型语言模型智能体常孤立运行,难从经验学习。SKILLRL受人类技能启发,提出有效经验迁移需抽象。它通过经验驱动的技能蒸馏、分层技能库和递归技能进化机制,在多实验中表现出色。

PaperAgent
产品应用7

首个OpenClaw智能体宿主机性能评测报告:单机可稳定运行96路Agent实例

OpenClaw成中小企业AI利器,但企业部署面临效率、并发和安全问题。浪潮信息基于元脑x86服务器完成测试,发布评测报告,该服务器单机可稳定运行96路Agent实例,还支持一键配置、多用户隔离。

AI进修生
产品应用8

今天,被GLM-5的Agentic Coding能力惊艳到了

上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。

PaperAgent
算法论文8

AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。

量子位