编程基准」共找到 1887 篇相关文章

推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。

CourseAI
算法论文8

一篇19种自进化Agent Skill框架最新综述

这篇来自Rutgers大学和UNC Charlotte的survey,首次系统梳理Agent技能的进化与评估全貌,覆盖19种技能进化方法和10个评估基准。指出当前评估体系有诸多不足,如无法追踪技能多轮反馈后是否变好等。

PaperAgent
开源动态8

GLM-5深夜登场,这是国产开源模型首次逼平Claude Opus 4.5。

GLM - 5深夜发布且开源,参数量从355B扩展到744B,跑分仅次于顶级模型,开源排第1。能力逼近Claude Opus 4.5,BrowseComp基准得分超普通GPT - 5.2。价格便宜,是国内可用且性价比高的大模型。

数字生命卡兹克
算法论文8

谢赛宁、李飞飞、LeCun联手提出多模态LLM新范式,「空间超感知」登场

纽约大学助理教授谢赛宁与李飞飞、Yann LeCun 合作提出「Cambrian - S」,迈出视频空间超感知探索第一步。该研究引入 VSI - Super 基准,还提出预测性感知范式,在空间认知任务上有提升,相关论文值得视频多模态研究者参考。

机器之心
新闻资讯7

承认自己开源不行?转型“美国DeepSeek”后,两个谷歌研究员的AI初创公司融到20亿美元,估值暴涨15倍!

AI创业公司Reflection AI由两位前Google DeepMind研究员创立,仅一年就完成20亿美元融资,估值达80亿美元。它从编程领域起步,推出代码理解智能体Asimov,现转型为开源替代公司,要打造开放模型。

InfoQ
新闻资讯7

GPT-5刚刚正式发布,首次面向免费用户开放

OpenAI正式发布GPT - 5,有架构统一、性能大幅提升、全用户开放三大核心变化。测试数据显示性能进步明显,采用新定价策略面向所有用户开放。但演示未带来突破感,编程能力还面临Claude Opus 4.1挑战。

AI工程化
开源动态8

本地Opus你要不要!Qwen3.8-27B开源

阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万。其性能超Opus4.6,与顶尖模型相当,量化后普通电脑就能跑,原生多模态,编程、Agent、多模态跑分表现出色。

AIGC开放社区
新闻资讯7

一句“Hi”,80$蒸发!O3-Pro:地表最强,也最“坑”的AI!

昨晚ChatGPT宕机,OpenAI 2折甩卖o3模型并发布o3 Pro。o3 Pro编程能力强,达全球top150程序员水准。官方称甩卖的o3是原版但推理快近40%。o3使用成本高,还需足够上下文。

探索AGI
算法论文8

从打分器到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心
新闻资讯7

糟糕,Claude Opus 4.7源代码级提示词曝光!底层设计全被看光

Claude Opus 4.7如期而至,性能全方位提升,编程暴打Gemini 3 Pro、GPT - 5.1。Claude Code之父分享最佳实践,还曝光系统级提示词,揭示其进化逻辑,此外还提及Mythos的一些危险操作。

新智元