「代码生成基准」共找到 4179 篇相关文章
Node.js 拟内置虚拟文件系统,AI 生成代码引争议
Node.js 技术指导委员会成员 Matteo Collina 提议在 Node.js 核心新增 `node:vfs` 模块引入原生级虚拟文件系统,引发关注。功能可解决常见工作流程难题,已获部分开发者支持,但因用 AI 开发引争议。
AI研发新范式:基于技术方案全链路生成代码
文章指出过往代码补全方式存在局限,腾讯广告审核团队探索新AI开发范式。介绍业界AWS、Lovable范式,阐述审核团队实践范式,含定义、技术选型、过程标准化等,还提及进展、困难与未来展望。
ImageNet分数越高,生成反而越糊?iREPA给出解释
Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。
Claude Sonnet 4 上下文翻 5 倍!100 万 token 能处理更大型代码库,AI 代码分析起飞。
Claude Sonnet 4 加入‘百万 token 俱乐部’,上下文容量翻 5 倍达 100 万,能处理大型代码库。不过功能在 Beta 有使用门槛和限制,价格也有变化,还对比了市场上其他模型。
秒改屎山代码、最高提效 300%!AI 代码审查工具会终结技术债务还是带来新危机?
当下AI代码审查工具引发热议,虽宣称提效300%,但实际表现存争议。InfoQ采访硅心科技专家,探讨其利弊、核心能力、不同工具差异等,还提及应对问题的策略及未来审查流程演变等内容。
AI代码审核平台Greptile正洽谈3000万美元融资
TechCrunch消息,AI代码审查初创公司Greptile正洽谈3000万美元A轮融资,估值1.8亿美元。其由Dasksh Gupta创立,已获400万美元种子轮融资。代码审查领域竞争激烈,Greptile员工工作时长很长。
ICLR 2026 oral | AI代码真能进生产环境?SwingArena:从「写对代码Commit」到「通过CI审查」
过去一年大模型写代码能力提升,人们思考其能否参与软件工程核心流程。现有评测基准有缺失,SwingArena填补空白,将博弈引入评测,设计检索增强流水线,其开源后或成评估AI编程能力新工具。
大模型能否为不同硬件平台生成高性能内核?南大、浙大提出跨平台内核生成评测框架MultiKernelBench
深度学习计算依赖底层内核,当前多由开发者手工编写。南大、浙大推出开源评测框架MultiKernelBench,打破现有评测基准局限,构建模块化评测体系,多模型实测,还指出LLM短板并明确未来方向。
JinaVDR: 一个图文混排文档搜索任务的基准集
现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。
ACL 2025 | 大语言模型正在偷改你的代码?
本文聚焦大语言模型在代码推荐中的「供应商偏见」,通过分析7个主流大模型在30个场景的59万次响应,发现模型会偏好特定供应商,甚至擅自修改代码,还探讨了风险、局限并给出展望。