Coding 基准测试」共找到 2898 篇相关文章

产品应用7

我在微信免费养「龙虾」,玩到上瘾,这组CP太强了

2026 开年「龙虾热」渗透各类任务场景,腾讯动作密集。其自研 WorkBuddy 优势明显,与微信 ClawBot 联动成「官配」。经测试,它能高效处理多类任务,还为用户提供权益,腾讯龙虾矩阵加速成形。

机器之心
算法论文8

文言文秒杀所有大模型!100%攻击成功,轻松突破安全防线

南洋理工等机构团队提出基于文言文语境的自动化黑盒测试框架CC - BOS,利用果蝇算法和8维策略空间,暴露主流大语言模型安全盲区,实验显示对6款主流模型攻击成功率达100%。

AIGC开放社区
算法论文7

做RAG这一年,最后悔的就是上知识图谱

基于知识图谱的检索增强生成在问答任务中存在三元组索引丢失上下文语义问题,作者提出MDER - DR双阶段框架,在标准测试和特定数据集上性能提升最高66%,还具备多方面优势。

PaperAgent
新闻资讯7

安全的下一个好赛道,非常值得研究

近几年机器人发展火爆,摩根士丹利预测到2050年产业规模或超5万亿美元。但机器人领域安全复杂,研究团队用CAI框架对三款消费级机器人渗透测试,揭示严重安全问题,且行业整体对安全无知。

AI与安全
产品应用8

震惊海外开发者!BOSS直聘3B小模型比肩80B,怎么做到的?

BOSS直聘楠北阁团队发布3B轻量端侧小模型Nanbeige4.1-3B,性能震惊海外开发者。团队从多方面改进,如优化推理和偏好对齐,重构训练数据,采用多种强化学习算法,使其性能比肩大模型。

AIGC开放社区
新闻资讯8

吴恩达复盘百度岁月:我带过的自动驾驶、智能音箱都成了!Altman 我也带过,但 Gemini 3 比 ChatGPT 强

吴恩达团队提出新版图灵测试界定 AGI,避免行业泡沫。在播客中他还谈及 AI 关键议题,指出 AGI 短期难实现,规模化非唯一路径,AI 不会大面积取代岗位,中美 AI 各有优势等。

AI前线
开源动态8

字节清华智能体自动写CUDA内核,比torch.compile加速2.11倍

字节Seed与清华AIR团队开源CUDA Agent,在GPU内核优化基准KernelBench上成绩优异。它是大规模智能体强化学习系统,训练数据经多阶段构建,分阶段训练,全面超越商业模型,还开源了训练数据集。

量子位
7

10小时连崩4次、Claude疯狂宕机!刚把ChatGPT干到295%卸载量,就没顶住二次“爆红”?

昨日,Anthropic旗下Claude及Claude Code服务中断,10小时内连崩4次。此前特朗普下令停用Claude,但其用户量激增,还让ChatGPT卸载量暴涨295%,Anthropic还升级Claude记忆功能降低迁移门槛。

AI前线
推荐文章8

AI编程的下半场来了?学会用Agent Skill解决编程的痛点问题

文章分享用 Agent Skill 解决 AI Coding 痛点的实操复盘,如让代码上线、解决 AI 不用 Skill 问题。介绍 Skills 原理、CloudBase Skills 优势及与 MCP 组合,还给出实战案例、踩坑经验和未来规划。

腾讯技术工程
新闻资讯8

Anthropic CEO Dario Amodei 访谈:我们正在接近指数的终点

Anthropic CEO Dario Amodei 三年前预测基本兑现,此次访谈更放豪言,称 1 - 3 年内有 50% 概率出现“天才之国”,10 年内 90% 确信。访谈覆盖诸多关键问题,如 Scaling 原理、AI 编程生产力、AI 公司盈利模式等。

宝玉AI