基准榜单」共找到 1481 篇相关文章

新闻资讯8

Anthropic创始人盛赞Meta:开启广告基础设施「智能体进化」时代

Meta最新论文揭示基于树状思维链搜索的智能体框架,以“无人驾驶”方式重写广告系统底层内核,将内核开发时间从数周缩至数小时,生产环境性能最高提升17倍,Anthropic创始人高度评价。

新智元
算法论文8

「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式

针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型。

机器之心
产品应用8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。

机器之心
8

我们测试了百度的「AI 科学家」,它正在悄悄淘汰算法工程师

百度 2025 世界大会亮相的「伐谋」,是全球领先可商用自我演化超级智能体。它源于进化论,能让算法自我进化。实测显示其在生活场景和复杂决策问题上表现优越,架构精巧,将推动算法研发普惠化。

特工宇宙
开源动态7

3个硬核 GitHub 项目,让 AI 帮你赚钱!

nof1.ai网站举办“AI量化交易擂台”,让GPT - 4、Claude、DeepSeek等模型用1万美元本金在加密货币市场自动交易。目前DeepSeek排名第一,11天收益率超90%。文章介绍3个相关GitHub项目,可让AI在金融市场竞技、分析交易。

开源先锋
新闻资讯7

创新中心 | 2025首届“幻镜”AI视听测评季成果在京发布,探索AI视听领域建立科学测评体系

2025年10月28日,“人工智能赋能精品创作沙龙”暨首届“幻镜”AI视听测评季成果发布会在京举办,活动旨在为AI视听领域建科学测评体系。会上公布测评结果、优秀作品片,发布研究分析报告。

郎园Station
开源动态8

清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座

清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。

AIGC开放社区
算法论文8

大模型推理学习新范式!ExGRPO框架:从盲目刷题到聪明复盘

上海人工智能实验室等团队提出经验管理和学习框架ExGRPO,能科学管理经验。与传统RLVR方法比,它在不同基准提升性能,尤其复杂推理任务,还揭示滚雪球效应,为模型推理训练提供新思路。

量子位
开源动态7

超越ZIP的无损压缩来了!华盛顿大学让大模型成为无损文本压缩器

华盛顿大学SyFI实验室提出LLMc,利用大型语言模型进行无损文本压缩。基准测试显示其压缩率优于传统工具,且项目已开源。不过,当前版本存在效率、吞吐量等问题,应用范围也主要在自然语言。

量子位
7

Sora2五天下载量破百万!超越ChatGPT增长速度,App Store免费第一

Sora2五天下载量破百万,增长速度超ChatGPT,在App Store免费第一。其虽有使用门槛,但热度高,盗版泛滥。不过它也面临版权问题,审核收紧。AI创意应用取代传统社交媒体速度加快。

量子位