「Coding 基准测试」共找到 2871 篇相关文章
Claude Code之父红杉演讲震撼全场! 26年未写1行代码, 电脑都不开了
Claude Code之父Boris Cherny在红杉AI Ascent 2026大会上称,2026年至今未写过一行代码,现用手机工作。他预言编程已被AI解决,Claude Code代码库一年后或只剩100行,还认为软件业将民主化,创业公司迎来黄金时代。
前后端一起消失:AI Coding正在改写大厂工程师分工
大厂研发组织出现调整,美团前后端团队合并,蚂蚁网商让测试岗转研发岗。AI Coding普及使技术岗位划分重塑,前后端边界成“全栈能力”。AI编程工具虽有后端执行能力,但仍需资深工程师兜底。
MiniMax 上市后的第一个开源:给 Coding Agent 立个规矩
2026 年初 MiniMax 成功上市港股,市值达 1100 亿港币。其上市后首个开源项目 OctoCodingBench 聚焦 Coding Agent 评估,解决规则复杂时 Agent 合规问题,为其立规矩,有重要社区价值。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。
为什么AI总是"记错"你?我们造了一个"合成人生"来测试
现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。
Claude Code也要龙虾化!凌晨床上发条消息,Mac Mini瞬间亮屏狂敲代码
Claude Code团队宣布新增Channels功能,可通过MCP控制会话,首批支持Telegram和Discord。用户能手机远程控制AI写代码,目前已灰度测试。不过其功能依赖会话存活,后续或接入更多平台。
用于评估AI Web渗透测试能力的工具:XBow Bechmark,比靶机更好
文章介绍了用于评估AI Web渗透测试能力的XBow Benchmark,它已在github开源。该基准含104个Web安全挑战,涵盖多种漏洞,设计确保可重复性和状态持久性,其评估能力获广泛认可,还介绍了开源内容等。
你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench
剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。
全球首个多模态矢量动画生成框架,轻松拿捏跨平台轻量动画
复旦大学等团队推出OmniLottie框架,利用创新分词技术将视频、图文指令变成高质量矢量动画。团队还打造数据集MMLottie - 2M,构建测试基准MMLottie - Bench。实验显示,OmniLottie在多任务测试中优势明显。
刚刚,字节开源Seed-OSS-36B模型,512k上下文
深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在多基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。