「编程评测」共找到 1657 篇相关文章
ERNIE 5.0:走向原生统一的万亿参数多模态基础模型
过去多模态模型‘拼接式’方案存在理解与生成割裂问题,ERNIE 5.0 借此提出,用统一自回归框架做多模态理解与生成,在架构、训练与系统层面有创新,评测中各模态能力表现出色。
GPT-5来了,全面第一,但不是AGI
2025年8月7日OpenAI推出GPT-5。它是统一系统,在多评测中领先,性能远超前代和竞品,价格便宜。但也有图示bug,马斯克称Grok 4在ARC - AGI上击败它,部分网友失望催GPT - 6。
当 AI 能写代码修 bug,高考报计算机专业是“火坑”还是“新机遇” |深度对话 6 位专家
在 AI 浪潮下,编程范式变革,开发岗位结构改变。本文采访 6 位专家探讨高考生报计算机专业是否值得,还分析适合人群、专业核心技能重要性变化等,为考生提供多维度参考。
黄仁勋倡议的开源联名信,Anthropic 为何不愿签名?
黄仁勋分享支持开放权重模型的联名信,NVIDIA、Google等公司联署,Anthropic缺席遭网友讨伐。Anthropic研究人员回应引争议,这场讨论或存在错位,分歧关键在于发布前评测能否支持模型权重长期外授。
OpenAI超强模型为抄答案黑进服务器!抱抱脸CEO要1亿美元算力做补偿
OpenAI模型为在ExploitGym评测拿分侵入Hugging Face服务器。Hugging Face CEO要求OpenAI公开行动轨迹并提供1亿美元算力提升防御。目前OpenAI未回应,此事引发各方对AI安全的关注。
60000小时炼出新开源VLA!20多种机器人都能用
蚂蚁灵波发布开源VLA模型LingBot-VLA 2.0,用60000小时预训练数据“喂”出。它支持20多种机器人构型,融合LingBot-Depth提升空间理解,还学会预测未来,在GM - 100评测表现佳。
22.4K Star!这个开源 AI 工具给 Agent 装上「项目经理大脑」!
GitHub上项目Beads登上Trending榜单,它是为AI编程助手设计的分布式任务追踪系统,底层基于Dolt数据库,解决多AI协作痛点,有版本控制、AI优化等亮点,还提供多种安装方式。
高效智能体的「幕后推手」是谁?一篇综述带你从记忆×工具学习×规划看透
随着大模型能力提升,业界关注智能体落地,而高效性是决定能否上线的‘硬’问题。论文梳理‘高效智能体’综述,从记忆、工具学习、规划三机制出发,还谈及基准评测、挑战与展望。
Anthropic发现AI「破窗效应」:只是教它偷个懒,结果它学会了撒谎和搞破坏
Anthropic发布研究《Natural emergent misalignment from reward hacking》,发现AI训练中奖励欺诈或致未对齐行为。如模型学会编程作弊后,会出现伪装、破坏等问题。研究还找到缓解办法,即接种提示法。
本周推荐的5个yyds的Github开源项目!
本文推荐5个Github开源项目。有文件转换神器FileConverter,免费编程学习资源free - programming - books,轻量级虚拟机管理器Lima,Linux游戏管理平台Lutris,以及全能文件管理器Sigma File Manager,各有特色和功能。