基准数据集」共找到 3289 篇相关文章

开源动态8

快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!

快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。

AI前线
新闻资讯7

北大ChatExcel,获得千万级新投资

北大团队研发的ChatExcel完成天使轮融资,获近千万支持。资金用于产品研发和全球化推广。它是中国首个生成式AI Excel与数据分析智能体,已服务超百万用户,还启动了PreA轮融资。

量子位
新闻资讯7

The Batch: 866|GPT-5 起飞遇乱流

OpenAI推出GPT - 5及其系列模型,涵盖多种类型,有新功能与性能提升。但发布中路由器故障等问题让用户失望。它在部分基准测试表现佳,不过抽象推理能力有不足,还回顾了发布历程。

DeeplearningAI
算法论文8

ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准

上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。

OpenMMLab
开源动态8

字节开源终身记忆多模态智能体,长时记忆+RL,实测超Gemini‑GPT4o!

字节开源全球首个带终身记忆更新的全多模态智能体M3 - Agent,给其装上‘长期记忆’大脑。它构建实体记忆图谱解决现有Agent问题,架构含两个流程,代码实现有特色,跑分数据出色。

探索AGI
开源动态8

Meta刚刚开源DINOv3,横扫60+任务,无标注封神!

今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。

AIGC开放社区
新闻资讯7

AI 如何“征服”美国经济:一份图文并茂的常见问题解答

美国经济已分化为火热的 AI 经济和萎靡的消费经济。AI 领域支出、股市表现、商业数据都体现其热度。顶尖科技公司因丰厚利润大力投入 AI 基建,但目前盈利不明,员工对 AI 提升生产力看法不一。

宝玉AI
7

Clay 融资 1 亿美金估值 31 亿了,这个产品用 AI 广告弹窗一年 400 万美金收入

Clay 官宣 C 轮融资 1 亿美金,由 CapitalG 领投,估值达 31 亿美金。其付费客户超 1 万,CEO 称年底 ARR 或破 1 亿,接近盈利。还催生 GTM 工程师职业,合作数据商有望获 5000 万收入。

投资实习所
算法论文8

图灵奖得主Sutton再突破:强化学习在控制问题上媲美深度强化学习?

图灵奖得主Richard S. Sutton认为未来AI发展需靠强化学习。他将2024年的SwiftTD算法拓展到控制领域,提出Swift - Sarsa算法,还设计操作性条件反射基准测试。实验显示,结合预处理方法,其性能或媲美深度强化学习。

机器之心
新闻资讯7

Anthropic官宣「封杀」OpenAI!GPT-5发布在即,竟被曝用Claude Code做开发?

本周二,Anthropic切断OpenAI对其大语言模型的Claude API访问权限,指其违约用Claude支援GPT - 5开发及安全测试。此举标志AI巨头围绕数据与接口展开新一轮封锁战,API成战略资源。

新智元