「开源软件」共找到 3468 篇相关文章
不靠Agent,4步修复真Bug!蚂蚁CGM登顶SWE-Bench开源榜
蚂蚁集团代码图模型 CGM 基于开源模型,不靠 Agent 架构,用 4 步轻量级流程完成仓库级代码修复,在 SWE - BenchLite 公开排行榜成绩亮眼,打破闭源垄断,还解决了 LLM + Agent 架构的一些问题。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
红杉专访 OpenAI Codex 团队:AI Coding 的未来,应该是异步自主 Agent
红杉专访 OpenAI Codex 团队,探讨 AI Coding 未来。OpenAI 5 月推出的 Codex Agent 可并行处理多任务、独立完成编程全流程。从代码补全到任务委托,AI 编程朝解放生产力方向发展,团队分享了产品思考等内容。
DeepSeek新版R1直追OpenAI o3!实测来了:“小版本升级”着实不小
DeepSeek在端午节前更新R1新版本DeepSeek - R1 - 0528,看似小版本更新实则提升巨大,在LiveCodeBench上几乎与OpenAI o3 - high相当,实测显示编程等能力显著优化,直追闭源模型。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
10.6K star!再见了英文GitHub,这个汉化项目必须安排上,程序员力荐!
文章介绍实用开源项目`github-chinese`,它是GitHub界面汉化浏览器插件。由‘楼教主’开发、maboloshi维护,有开发版和发布版。有全面汉化等特色,还给出安装使用步骤,适合英文不好的新手。
AI可观测行平台Lightrun,获7000万美元
AI可观测性平台Lightrun获7000万美元B轮融资,由Accel和Insight Partners领投。它改变传统监测工具局限,实现实时调试修复。连续三季成G2领域领导者,获众多企业信赖,发展迅猛。
Anthropic 发布 AI Native 全流程实践指南
Anthropic应用AI团队发布实践指南,阐述如何将AI融入软件开发生命周期各环节。指出代码不再是瓶颈,构建快但周边流程慢。指南围绕六阶段展开,给出实施步骤、治理框架和度量指标。
本地部署Qwen 3.8 27B,要用什么配置
Qwen 3.8 27B是性能好、体积小的开源模型,个人也能本地部署。本地跑开源大模型,重点看容量和带宽两个指标,还介绍了Mac、RTX 5090、RTX PRO 6000三种部署方案及优缺点。
kimi K3超大杯升级背后的技术内幕
文章介绍开源模型 K3 架构设计思路。主要探讨 MoE 和 MLA 部分,在 MoE 方面提出 SiTU、Norm、QB 改进;在注意力机制选择 MLA,与 KDA 混合缓解部分问题,还谈及 DSV4、NoPE 相关特点。