代码能力评测」共找到 4810 篇相关文章

产品应用7

复制这套神仙配置,让Claude Code全自动修Bug!告别每天重复教AI写代码

Claude写代码常犯重复错误,根源是无跨会话记忆。Claude code创始人Boris Cherny爆料团队让Claude自纠错,并分享配置让其自动发现、修复错误且不再重犯,介绍各步骤及完整配置和前后对比。

AI寒武纪
算法论文8

对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌

中科大团队在 ICLR 2026 论文中指出 KV Cache 压缩领域底层假设存在缺陷,主流方法基于的稳定性假设在真实场景中脆弱。团队提出防御性聚合策略,仅两行代码修改,显著提升 KV Cache 压缩性能。

机器之心
算法论文8

无损减少80%激活值内存,提升5倍训练序列长度,仅需两行代码

港中文(深圳)和上海交通大学团队提出 StreamBP 算法,通过线性分解和分步计算,将大语言模型训练激活值内存降至梯度检查点的 20%,在相同内存下最大序列长度为其 2.8 - 5.5 倍,代码已开源。

机器之心
开源动态7

马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一

实时视频世界模型成热门,Loopit发布的实时互动世界模型Zing - 0.5在评测中获第一且已开源。该公司提出独特观点,认为实时视频非世界,互动应“模应一体”,还指出抵达端到端终局的新路径。

新智元
产品应用8

AI4S智能体「井喷」,这个智能体登顶多项评测榜单,实现产业落地

2026年是AI4S「智能体元年」,科研智能体产品密集发布,行业关注转向产品落地。深度原理发布的AI科学家平台Mira在多项评测中领先,其全链路闭环系统补齐传统短板,已在多领域落地验证。

机器之心
开源动态8

开源框架让代码AI偷师GitHub!bug修复率飙升至69.8%,性能创纪录

MemGovern团队联合多高校团队提出MemGovern框架,将杂乱GitHub数据转化为AI可用的结构化记忆。它构建筛选净化流水线,采用先搜后看模式,实验显示能显著提升代码智能体的bug修复率,还具跨领域推广价值。

量子位
算法论文8

模型合体!上交&上海AI Lab&华师提出LED-Merging,拒绝「能力」与「安全」二选一

上海人工智能实验室等团队提出LED - Merging解决模型融合“安全 - 效用冲突”问题。该方法无需训练,像“神经元手术刀”,不牺牲专业能力还提升安全性,论文已被ACL 2025 Main Conference接收。

深度学习自然语言处理
新闻资讯8

谷歌创始人罕见反思:低估 Transformer,也低估了 AI 编程的风险,“代码错了,代价更高”

谷歌联合创始人 Sergey Brin 在公开对话反思,低估了 Transformer 和 AI 编程风险。他认为 AI 写代码易出错,更适合创意类工作。还回顾谷歌发展,提及早期研究的自由氛围及后来的决策,指出算法进步比规模扩张快,算力如甜点。

AI前线
新闻资讯8

多模态文本智能白皮书发布!5大能力标准、11个行业案例全解析(附下载)

合合信息发布《文本价值觉醒,赋能智能决策——多模态大模型文本智能白皮书(2026)》,提出复杂文本智能五大核心能力标准,还通过11个真实行业标杆案例展示技术如何转化文档为决策力。

PaperAgent
新闻资讯7

4 个月 3000 万美金 ARR,做 AI 评测榜单的 LMArena 为何值 17 亿美金

AI评测产品LMArena半年前种子轮获1亿美金,现完成超1.5亿美金A轮融资,估值达17亿美金。其核心产品Chatbot Arena可对比AI模型回答并构建榜单,公布的数据或解答了其估值高的疑问。

投资实习所