「代码修复评测」共找到 2319 篇相关文章
Anthropic偷偷在Claude Code中植入了隐形代码,只为识别中国用户。
近期Claude大面积封号,国内用户几乎被封完。Reddit大佬逆向Claude Code发现,其会静默读取本地信息,通过操作系统时区和环境变量识别中国用户,用隐写术传输标记数据,引发开发者不满。
全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!
Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。
无需CUDA代码给H100加速33%-50%,Flash Attention作者新作火了
Flash Attention、Mamba作者之一Tri Dao与普林斯顿博士生提出QuACK库,用Python写,无需CUDA C++。在H100上比优化库快33%-50%,吸引英伟达、PyTorch团队关注。还给出优化torch.compile建议。
程序员从此不再写代码!红杉专访Codex团队,o3白菜价真相曝光
红杉专访OpenAI Codex团队,揭示AI编程未来。Codex从代码补全演化为智能体,强调委托心态,开发者从动手转向审核。还爆料OpenAI内部有递归自我改进的AI Alice。
刚刚,Cursor 版 Github 上线
昨天 GitHub 宕机,Cursor 团队趁势宣布代码托管平台 Origin 面向付费用户推 Beta 版。Origin 为 Agent 规模工作流设计,有代码仓库管理等功能,性能数据挑衅,此前曾提前曝光又撤回。
规范对齐时代:GPT-5 断层领先,让安全与行为边界更明晰
上海交通大学等团队提出规范对齐概念,构建评测基准 SpecBench 评测 33 个主流模型,发现多数模型有不足。还探索测试时深思方法,如 Align3 能提升规范遵循度,GPT - 5 在规范对齐上断层领先。
警告:你的Agent可能无法"解决"真实世界的视觉问题
文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。
开源AI开发生态大洗牌:低代码平台逆袭,传统LLM框架日渐式微
第十届527蚂蚁技术日,蚂蚁对现有开源生态全面剖析,发布2025大模型开源生态全景图。分析显示开源生态有三个主导技术赛道,还总结出七大趋势,为从业者提供生态演进规律参考。
从补全到 Agentic Edit:Trae 在代码编辑上的落地与进化
AI 编程助手走向智能化,Trae 团队历经“补全 + Chat → Apply → Builder + Cue”三阶段,解决文件定位、跨文件修改等难题,介绍 Apply 与 Search/Replace 方案适用场景,还将从三方面继续探索。
Vercel 发布新语言 Zero:代码不是写给人看的,而是写给 AI 的
Vercel Labs 发布实验性系统编程语言 Zero,定位是速度快、体积小且便于智能体使用修复。Zero 有工具链契约等特色,v0.3.0 有重大转变,不过在 Hacker News 上遭部分质疑。