「bug修复」共找到 257 篇相关文章
ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心
近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。
一个提示攻破所有模型,OpenAI谷歌无一幸免!
HiddenLayer研究发现一种「策略傀儡」提示,将危险指令伪装成配置片段,配上角色扮演,能让ChatGPT等主流大模型开启「无限制模式」。此策略利用训练弱点,难修复且可扩展,厂商需智能监控。
Vercel 发布新语言 Zero:代码不是写给人看的,而是写给 AI 的
Vercel Labs 发布实验性系统编程语言 Zero,定位是速度快、体积小且便于智能体使用修复。Zero 有工具链契约等特色,v0.3.0 有重大转变,不过在 Hacker News 上遭部分质疑。
腾讯「鹅虾」紧急上线!一手实测:养虾门槛归零,QQ飞书钉钉全能接
腾讯昨日上线两个「鹅虾」产品,WorkBuddy是能接入多平台的智能体桌面平台,QClaw预计下周公测,可接入微信。作者实测WorkBuddy,考察其生态接入、代码开发等场景表现,还介绍了QClaw特点及腾讯云轻量应用服务器。
AI 代码审查再进化:AutoDev 多智能体协作架构深度解析
现代软件开发中,代码审查存在信息割裂、人工效率低等痛点。AutoDev 借助多智能体协作与信息聚合,实现从分析到修复的闭环智能流程,还构建多 Agent 协作体系,未来将集成更多能力。
GPT-6 或有"生命"!MIT新作实现LLM自我进化,冻结权重时代终结
MIT新作《Self-Adapting Language Models》实现LLM自我进化,SEAL框架让模型自己生成“自编辑”微调自身。它能实时学新数据、修复知识、形成记忆。经两种场景验证,小模型也能超越GPT - 4.1等。
刚刚,奥特曼发布GPT-5!人人免费用「博士级」智能,基准图错误遭全网吐槽
OpenAI 发布 GPT - 5,奥特曼连发推文介绍看点。它是集成模型,有免费版、Plus 和 Pro 计划,多领域跑分亮眼。不过直播现小 bug,跑分图出错,马斯克拆台,表现未达部分人预期。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
GitHub 推出 MCP 服务器集成,全面扩展机密扫描功能
GitHub宣布MCP Server全面支持机密扫描功能,将其扩展至AI辅助和代理驱动的开发工作流,可让外部工具和AI工作流访问安全洞察、自动化修复。这反映安全工具正从被动检测转向自动化治理。
开源「洁癖.skill」,让你的Agent越用越聪明。
作者开源了名为洁癖.Skill的工具,它能在Agent完成功能或解决BUG后,自动审查项目文档体系和记忆文件并迭代,适用于Claude Code、Codex等四个平台,解决上下文混乱问题,让Agent越用越聪明。