编程基准」共找到 1887 篇相关文章

开源动态8

1.2万人收藏单日斩获 3.4K!刚刚冲上 GitHub Trending 榜首的“AI 红队”工具!

AI加速代码编写,但也留下更多安全坑,传统扫描工具和人工渗透测试难以应对。新晋GitHub Trending榜首工具Shannon是全球首个开源全自动AI渗透测试员,多智能体架构,功能强大,适合AI编程团队。

开源星探
算法论文8

微调重要表征以增强思维链的推理能力

团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。

深度学习自然语言处理
开源动态8

Kimi新模型拿下代码开源SOTA,仅仅72B,发布即开源

深夜,Kimi发布新开源代码模型Kimi - Dev,在SWE - bench Verified上以60.4%成绩获开源SOTA。参数量72B,编程水平强。采用MIT协议,权重和代码已发布。官方透露了部分关键技术,更多细节待后续报告。

量子位
新闻资讯8

英伟达改卖Token?黄仁勋GTC后发声:token就是AI新通货,值钱的不是算力,是“每度电的智商”

英伟达黄仁勋在采访中强调其是加速计算公司,非单纯 GPU 公司。他认为 AI 竞赛从拼算力变拼产出,token 是新通货,还阐述了 AI 瓶颈、架构发展、推理编程、CPU 角色等观点。

AI前线
开源动态8

500行极简开源框架,硬刚GPT/Gemini视觉极限!

多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI构建SWE-Vision框架,让模型用代码处理视觉判断,在五个视觉基准测试达最优,其极简设计有效且泛化性强,代码已开源。

新智元
新闻资讯7

Cursor押注云端Agent!CEO 放话:审核AI代码是开发者最核心竞争力

Cursor CEO 称 AI 编程进入第三时代,智能体可少人工介入完成复杂任务,开发者角色转变。Cursor 团队超三分之一 PR 由云端智能体生成,不过这引发了开发者对代码审查、工作流、安全等问题的讨论。

InfoQ
产品应用8

从GLM-4.5到GLM-5,我见证了一个模型从码农晋升为架构师

智谱以匿名方式将GLM - 5放到OpenRouter公测,其表现亮眼。在AI编程从Vibe Coding转向Agentic Engineering的背景下,GLM - 5参数规模提升,成绩优异,实测决策有架构师思路,持久力强,不再只是‘平替’。

花叔
产品应用7

全球首款!高性能人形机器人跑跳进入万元机时代

全球首款万元以内高性能人形机器人Bumi登场,能跑会跳还能当编程老师。它由松延动力打造,团队成员多来自清华,此前已有多款硬核机器人产品,Bumi让具身智能走进日常生活。

量子位
开源动态8

你敢信?GPT-5的电脑操作水平只比人类低2%了

Agent S3刷新了计算机使用智能体(CUA)在「OSWorld」基准测试的记录,性能达69.9%,接近人类水平。它引入bBoN实现并行扩展,还精简框架、引入原生代码智能体,已开源并发布论文。

机器之心
算法论文8

苹果掀桌!扔掉AlphaFold核心模块,开启蛋白折叠「生成式AI」时代

蛋白质折叠是计算生物学核心难题,SimpleFold作为首个仅基于通用Transformer模块的蛋白折叠模型,摒弃AlphaFold2系列传统架构,能将蛋白序列生成三维原子结构,在多基准测试表现强劲,还可生成结构集合。

新智元