写码能力」共找到 3783 篇相关文章

算法论文8

ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准

上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。

OpenMMLab
算法论文8

知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳

东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。

量子位
推荐文章7

“都什么年代了程序员还在手搓代,连小白都能 Prompt 生成代了”

现在很多人标榜用 AI 高效,贬低手搓代。作者认为两者都是的手段,不是目的,不能对立。并从多方面分析适合 AI 或手搓代的场景,强调二者搭配使用能事半功倍。

宝玉AI
新闻资讯8

10天随手的AI,竟在GitHub狂飙7万星!「它开口那一刻,我吓懵了」

新智元报道,Clawdbot爆火,GitHub星近7万。它由Peter一人玩10天手搓而成,自主解决问题能力惊人。后因Anthropic介入被迫更名Moltbot,还引发加密玩家不满。有人用它交易一晚赚247美元。

新智元
算法论文8

AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
新闻资讯7

18天光速打脸!OpenAI刚夸TypeScript最合适,转头就用Rust重Codex CLI

OpenAI推出AI编神器Codex,向ChatGPT Plus用户开放,还增加互联网访问功能。此前其宣布用Rust重Codex CLI,该项目维护者Matin入职刚一年,半月前还称TypeScript最合适。改用Rust可带来多方面改进。

AI前线
算法论文8

王梦迪、丛乐团队Science Earth:当组织本身开始涌现,全球科学能力第一次在同一张网上互相发现

王梦迪、丛乐团队在arXiv发布预印本论文,推出面向AI原生科学发现的行星级操作系统Science Earth,它能连接全球科学能力。文中通过两个案例展示其作用,并介绍协调内核EACN,还公开了论文、代与网络。

量子位
算法论文7

姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench

腾讯混元团队和复旦大学研究人员联手推出全新基准测试CL - Bench,系统性评估大模型上下文学习能力。测试显示十大前沿模型表现不佳,揭示当前大模型在该能力上的普遍短板,并指出未来四个探索方向。

AI寒武纪
新闻资讯7

复读一年,AI 把高考数学成绩从及格线提到 145 分!AI 数学能力发生了什么?

今年媒体让AI做高考数学题,Gemini 2.5 Pro获145分排第一。从去年到今年,AI数学能力指数级增长,这得益于推理模型。推理模型用思维链和强化学习解题,未来高考数学或难区分模型能力

宝玉AI
算法论文7

中移动九天团队MultiPL-MoE:全新Hybrid-MoE架构用于增强通用大模型低资源代能力

大语言模型在有限计算资源下提升多语言代能力面临挑战。中国移动九天团队提出 Hybrid MoE 架构 MultiPL - MoE,耦合两层专家选择机制优化,实验证明其在增强低资源代能力、缓解高资源语言遗忘上有效。

机器之心