Paper2Code」共找到 2745 篇相关文章

算法论文7

Claude Code新功能Auto Mode能否替代人工审核?首个压力测试来了

随着AI coding agent走向“直接执行开发操作”,Anthropic为Claude Code推出Auto Mode。香港科技大学与ETH Zurich研究团队对其进行首个系统压力测试,发现Auto Mode端到端误放行率达81.0%,部分危险操作绕过审核。

机器之心
新闻资讯7

“Claude Code更新废了”!热议Issue:思考深度下降67%,已无法胜任复杂的工程任务

AMD的Stella Laurenzo分析发现,Claude Code某次更新后思考深度降67%,无法胜任复杂工程任务,行为走样。团队回应redact - thinking是UI改动,2月两项改动或有影响,但网友并不买账。

量子位
产品应用8

GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂

为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。

AI寒武纪
产品应用8

别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程

作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。

AI产品黄叔
产品应用7

AI 写代码老出错?Code Rabbit 来给 Cursor 当“纠错教练”,边写边改。

Cursor的AI Agent写代码虽强但易出错,Code Rabbit可当“纠错教练”。它本用于审查GitHub PR和commit,现推出VS Code、Cursor等插件,能分析代码改动、提建议,与Cursor配合可减少bug。

AI进修生
开源动态8

杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议

上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。

AI前线
产品应用7

适用所有团队研发提效|带你1分钟上手基于Claude Code的AI代码评审实践

文章介绍用Claude Code和AONE MCP Server实现智能AI代码评审。分析当前CR流程痛点,阐述解决方案架构、配置及效果,提效超50%,还给出使用方式、建议与后续优化方向,为团队AI提效提供参考。

阿里云开发者
产品应用7

Claude Code凭什么牛?大模型团队天天用自家产品,发现bug直接就改了

Claude Code虽有争议,但很成功,4个月用户达11.5万。Claude Code负责人透露构建细节,如产品理念、评估标准、反馈机制等,还阐述编程领域变化、模型与工具共同进化等内容。

机器之心
开源动态8

张雪机车燃爆封神!国产2B语音模型重磅开源,全网听完都起鸡皮疙瘩

面壁智能联合多方开发的2B小模型VoxCPM 2于4月开源,支持30种语言与9大方言,能实现声音克隆、情绪控制、音色设计等功能。实测显示其能力出色,还提供全家桶级工具箱,采用独特技术路线。

新智元
新闻资讯7

半年不写代码,Claude Code之父:3年后写代码的人暴涨100倍

Claude Code之父Boris Cherny称,虽软件工程师职称或消失,但3年后写代码、用智能体的人会是现在100倍。他列出Claude Code团队的5种角色,指出岗位边界在融化,AI时代清理者角色更关键。

新智元