「自动代码审查」共找到 2172 篇相关文章
Leogra AI:BVP 投资的欧洲版 Harvey,给每位律师配一位协作 Copilot
本文介绍瑞典法律AI公司Legora,其获1.5亿美元C轮融资,估值18亿。它让律师与AI并行工作,产品覆盖审查等环节。文中还阐述法律科技变革,以及其商业模式、竞争风险、团队文化和全球化策略等。
地球级AI智能体爆诞!谷歌地球开外挂,一夜为20亿人洪水预警
谷歌结合世界建模经验与Gemini推理能力,升级Earth AI。它是地理空间AI模型和数据集,可自动连接不同地球AI模型。谷歌还推出新成果,如新一代影像与人口基础模型、空间推理智能体,可用于灾害预警等。
AI本该助力新人,为何反而让高手更强?
人们曾认为AI能让初级程序员创造高质量代码,减少对高级工程师依赖。但现实是‘高手 + AI’才是有效组合。文章分析AI优劣,指出其让高手更强,还给出使用建议,强调要校准对AI的期待。
超越DeepSeek-R1,数学形式化准确率飙升至84% | 字节&南大开源
字节跳动Seed团队与南京大学联合发布CriticLean框架,将数学自然语言到Lean 4代码的形式化准确率从38%提升至84%。该框架创新性地将评估模型置于核心,解决语义对齐等问题,还构建了相关基准测试和数据集。
超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭
近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率低。
大模型进入研发体系后,我们看到了这些变化
InfoQ《极客有约》X AICon 直播邀请同程、网易、百度工程师探讨大模型入研发体系的变化。指出其在提效、协作、分工上作用大,还分析了适用场景、工程师收益类型及核心竞争力等,也提及效率评估、代码生成等问题。
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
Qwen 3-235B Aider编程能力击败Claude3.7,成本便宜百倍
Qwen3-235B-A22B在Aider多语言编码基准初步测试中击败Sonnet 3.7 Thinking和OpenAI o1,成本便宜150到600倍。Qwen3-32B准确率超GPT-4.5和GPT-4o ,代码编辑格式正确率达100%。
正式版发布!DeepSeek-V4-Pro-0813
8月13日晚,DeepSeek-V4-Pro-0813正式版发布。此次升级将Agent维度提升至无短板的第一梯队,具备1M+384K长任务能力,接口双兼容,技术创新多。还公布评测对比、价格并发设定,给出实战代码案例与启示。
两个小时,10美元,Karpathy做了一个《指环王》3D游戏
Andrej Karpathy 让 Opus 5 根据《指环王》开篇文字,用 Three.js 制作三维场景,成本约 10 美元,两小时写出 5500 行代码。虽效果粗糙但有趣,他设想未来大模型能按需生成虚拟世界,不过也暴露大模型难以检查成果的问题。