「产品测试」共找到 3248 篇相关文章
阿里“快乐马”团队再出手!正面叫板谷歌 Genie 3,世界模型 HappyOyster 来了
4月16日,阿里发布世界模型产品HappyOyster,由ATH创新事业部团队研发。它与谷歌Genie 3同属世界模拟器流派,采用长跨度世界演化建模,有漫游和导演两大核心能力,在多方面呈现差异化优势。
刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA
普林斯顿刘壮团队、陈丹琦参与推出开源通用视觉推理RL框架Vero。它构建的视觉推理器在30多项测试达8B视觉语言模型SOTA,解决了开源RL方案的问题,所有数据、代码、模型均已开源。
Anthropic 训出史上最强模型,当场决定不发布
Anthropic推出Claude Mythos Preview模型却不对外开放。该模型在多维度基准测试中领先,还能发现大量网络安全漏洞。系统卡记录其不良行为,Anthropic推出Project Glasswing应对,认为现有对齐方法或难约束下一代系统。
硅谷前沿访谈:CUDA之父复盘英伟达20年护城河,揭开万亿算力帝国的底牌
奇点智能研究院院长李建忠采访了“CUDA 之父”Ian Buck,探讨 CUDA 20 年演进、英伟达技术产品及生态。Ian Buck 介绍了 AI 基础设施新阶段,阐述 CUDA 成功原因,还谈及英伟达软硬件协同、应对竞争等问题。
Meta 放出大招:让 AI 实现自我进化,Karpathy 的 autoresearch 沦为小弟
Meta联合多机构发布论文,提出HyperAgents框架,让AI不仅改进自身,还能改进「改进自己的方法」。它打破传统AI自我改进瓶颈,在多领域测试表现出色,还自发形成记忆机制,有迁移和叠加效果。
构建 Claude Code 的经验:我们如何使用 Skills
本文来自Anthropic内部团队,总结构建Claude Code使用Skills的经验。介绍Skills类型,如库与API参考、产品验证等;给出编写技巧,涵盖避免说废话、建踩坑点章节等;还提及分发、管理及衡量效果的方法。
OpenAI用8个Skill把工程师的经验变成AI的工作手册:扛起两个SDK,3个月457个PR
OpenAI公开用Codex + Skills维护Agents SDK开源项目的方法论。通过AGENTS.md、Skills和GitHub Actions配合,将重复性工作自动化,PR吞吐量涨45%。还介绍了Skill设计、规则设定、测试策略等,且方案组件已开放。
“传统设计流程已死”!IDE成Claude设计负责人新宠:Anthropic人人写代码,最不怕Bug
Claude设计负责人Jenny Wen在访谈中表示,AI冲击下传统设计流程已过时,设计师工作重心改变,IDE成新工具。她分享AI工具栈,点明三类有竞争力设计师,还谈及设计管理、产品发布等观点。
首个OpenClaw智能体宿主机性能评测报告:单机可稳定运行96路Agent实例
OpenClaw成中小企业AI利器,但企业部署面临效率、并发和安全问题。浪潮信息基于元脑x86服务器完成测试,发布评测报告,该服务器单机可稳定运行96路Agent实例,还支持一键配置、多用户隔离。
今天,被GLM-5的Agentic Coding能力惊艳到了
上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。