「产品测试」共找到 3226 篇相关文章
喂给AI的Skill正让它变笨!清华团队发现大模型经验复用的黄金法则
清华大学与EvoMap团队研究发现,给大模型提供详尽纠错Skill会使基准测试通过率下跌,而精简控制指令可提升性能。他们提出将程序化Skill转化为策略基因,经实验证实其更适合驱动智能体测试时演化。
BesiegeField:LLM能否学会设计机器?
香港中文大学推出基于游戏《Besiege》的测试平台BesiegeField,探讨LLM能否学会设计机器。研究通过组合式机器设计视角,测试LLM,提出多智能体迭代设计流程等,发现LLM有挑战但并非不可实现,如Gemini 2.5 Pro表现不错。
马斯克吹牛了吗?Grok 4第一波实测出炉:既能完虐o3,也菜到数不清6根手指
马斯克称Grok在各学科达博士后水平,激起网友兴趣。博主测试显示Grok 4在多项测试中完胜o3,网友还用它写游戏、让概念可视化。不过Grok 4也有翻车表现,马斯克称其仍有改进空间。
腾讯悄悄出了个插件版“Cursor”,还跟微信小程序打通了。
腾讯云发布代码助手CodeBuddy 3.0,它是插件而非IDE产品,可在多代码产品安装。其亮点是打通微信开发,能直出小程序。作者体验后用它半小时做出小程序,期待腾讯AI生态发展。
不做手机缩小版:AI 健康记录迁到手腕,要跨过哪些工程鸿沟?
文章围绕HarmonyOS的穿戴应用,如‘小卡健康’等,探讨将AI健康记录迁移到手腕面临的工程挑战。介绍了应用场景、系统能力调用,以及从接口到产品可用需解决的问题,强调要以用户体验为导向进行产品优化。
AI硬件闭门探讨:未来硬件只是数据的入口,接下来是「软件定义硬件」的时代
文章围绕AI硬件展开探讨,介绍了如Plaud录音卡片、智能眼镜等产品现状。指出多数用户对当下AI硬件不满,市场尚处早期。分析不同产品成功因素、竞争压力,还提及情感陪伴类产品问题,强调未来是「软件定义硬件」时代。
融资千万的 Violoop ,要做中国版的「硬件龙虾」
AI科技公司Violoop创始人何佳霖,想做中国版“硬件龙虾”,让AI 24小时为人类打工。其产品是手掌大小桌面硬件,3月12日完成数千万元融资,将用于产品落地等。团队最初尝试纯软件路线,后因安全等问题转向硬件。
登顶TPC-C!数据库分布式扩展技术揭秘
阿里云PolarDB云原生数据库以超原记录2.5倍性能登顶TPC - C基准测试排行榜。本文揭秘PolarDB MySQL版多主集群(Limitless)架构与核心技术,还介绍高可用机制、性能测试结果,最后提及轻量版和列存索引应用。
李建忠:关于AI时代人机交互和智能体生态的研究和思考
在2025全球产品经理大会中,奇点智能研究院院长李建忠分享了大模型驱动的AI产业生态和产品创新。他谈到推理范式转换使模型进入“经验数据时代”,还分析了应用开发、人机交互范式转换及智能体生态演进,预言孤立App时代终结。
对话宋亚宸:从 3D 生成到世界模型,VAST想搭一套「可交互世界」的底座
VAST是一家专注通用3D大模型研发与落地产品建设的人工智能公司。创始人宋亚宸表示,3D生成未普及是缺3D UGC平台,所以从工具和模型入手。该公司核心产品Tripo Studio成果显著,今日还宣布完成5000万美元A轮融资。