「编程基准测试」共找到 2946 篇相关文章
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
Claude 吞噬整个AI编程栈?“Vibe Coding 公司的最大错觉是以为自己有护城河”
近日网友爆料 Anthropic 开发类似 Lovable 功能,要构建全栈式 Vibe 编码平台。此前 Claude Code 源码泄露,显示 Anthropic 补齐 AI 开发栈。AI 编程进入‘大收割时代’,模型厂商吞噬工具趋势显现,Lovable 等面临挑战。
ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准
文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。
Claude 吞噬整个AI编程栈?“Vibe Coding 公司的最大错觉是以为自己有护城河”
近日网友爆料Anthropic开发类似Lovable功能,可构建全栈应用。此前Claude Code源码泄露,展示其构建软件开发全流程“执行层”能力。AI编程进入“大收割时代”,模型厂商吞噬工具趋势显现,Lovable等平台护城河受挑战。
10K Star!这个 AGENTS.md 开源项目太赞了,AI 编程助手彻底悟了!
AI 在看 README 时理解能力差,被戏称“智商只有三岁”。AGENTS.md 是专门写给 AI 编程智能体的文档格式,已获 10K Star,可助其理解项目,还介绍了与 README.md 的区别、使用方法等。
Claude Sonnet 4.5被炸出来了,依旧最强编程,连续30小时自主运行写代码
新发布的Claude Sonnet 4.5在SWE - bench等多项测试中成绩提升,能连续30小时自主写代码,还改善了对齐和安全性指标,且提质不加价。此外,Anthropic官宣Claude Agent SDK,发布Imagine with Claude功能。
浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力
浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。
53.7% 高学历政企人员“看走眼”!公文写作AI智能体首次通过图灵测试
2025数博会期间双盲测试中,53.7%高学历政企人员将‘方寸智脑’生成公文误判为人类作品。它与华为云合作,解决政务AI落地困局,实现政务公文写作三阶跨越,已服务众多用户。
告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25
埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。
谷歌创始人罕见反思:低估 Transformer,也低估了 AI 编程的风险,“代码错了,代价更高”
谷歌联合创始人 Sergey Brin 在公开对话反思,低估了 Transformer 和 AI 编程风险。他认为 AI 写代码易出错,更适合创意类工作。还回顾谷歌发展,提及早期研究的自由氛围及后来的决策,指出算法进步比规模扩张快,算力如甜点。