Coding测试」共找到 2563 篇相关文章

算法论文8

喂给AI的Skill正让它变笨!清华团队发现大模型经验复用的黄金法则

清华大学与EvoMap团队研究发现,给大模型提供详尽纠错Skill会使基准测试通过率下跌,而精简控制指令可提升性能。他们提出将程序化Skill转化为策略基因,经实验证实其更适合驱动智能体测试时演化。

AIGC开放社区
算法论文7

BesiegeField:LLM能否学会设计机器?

香港中文大学推出基于游戏《Besiege》的测试平台BesiegeField,探讨LLM能否学会设计机器。研究通过组合式机器设计视角,测试LLM,提出多智能体迭代设计流程等,发现LLM有挑战但并非不可实现,如Gemini 2.5 Pro表现不错。

带你学AI
新闻资讯7

马斯克吹牛了吗?Grok 4第一波实测出炉:既能完虐o3,也菜到数不清6根手指

马斯克称Grok在各学科达博士后水平,激起网友兴趣。博主测试显示Grok 4在多项测试中完胜o3,网友还用它写游戏、让概念可视化。不过Grok 4也有翻车表现,马斯克称其仍有改进空间。

机器之心
产品应用8

登顶TPC-C!数据库分布式扩展技术揭秘

阿里云PolarDB云原生数据库以超原记录2.5倍性能登顶TPC - C基准测试排行榜。本文揭秘PolarDB MySQL版多主集群(Limitless)架构与核心技术,还介绍高可用机制、性能测试结果,最后提及轻量版和列存索引应用。

阿里云开发者
推荐文章7

只会「氛围编程」,永远成不了真正工程师!还差这几个关键环节

火遍全网的「氛围编程」(Vibe Coding)让编程门槛降低,但与专业软件工程师仍有差距。文章解析了差距所在,如AI编程需精确指令,软件工程复杂,对程序员「品味」要求变高,还探讨了编程未来及Vibe Coding的挑战。

新智元
新闻资讯7

好你个智谱,模型价格搞双标:中国一套外国一套

网友发现智谱Max计划国内外价格差异大,中国469元(约68美元),西方160美元,引发热议。Hugging Face产品负责人力挺GLM - 5.1,而Claude被曝性能下滑、成本增加。

量子位
产品应用8

快手进军AI编程!“模型+工具+平台”一口气放三个大招

AI编程竞争激烈,快手发布AI编程产品矩阵进军该赛道。其“三位一体”矩阵含顶尖自研模型、智能开发工具和MaaS平台,KAT - Coder - Air轻量版免费。各产品亮点多,助力构建AI编程新生态。

量子位
开源动态7

Kimi开源又放大招!20秒更新万亿参数的中间件来了

Kimi开源出新中间件checkpoint - engine,让Kimi K2万亿模型参数进入“秒更时代”。它能支持一次性发送更新权重,实现点对点动态更新,在K2中发挥重要作用,还可抵御单点故障。

量子位
新闻资讯7

苹果炮轰AI推理遭打脸,GitHub大佬神怒怼!复杂任务≠推理能力

苹果发表论文指出推理大模型存在重大缺陷,相关解读在社交平台广泛传播。但GitHub高级工程师Sean Goedecke对论文持保留态度,认为谜题不是评估推理能力的好试验场,模型放弃不代表无推理能力。

新智元
算法论文7

Veo何止生成视频:DeepMind正在用它模拟整个机器人世界

通用型机器人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机器人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。

机器之心