规模化评测」共找到 768 篇相关文章

推荐文章7

ToC智能体火得快,但更大的价值在企业丨中关村科金@MEET2026

在大模型与智能体快速普及当下,中关村科金总裁喻友平判断AI时代核心是连接更强。他提出企业智能化是长期工程,真正让智能体规模化落地需重构底座平台能力,还介绍了应用场景等。

量子位
新闻资讯8

GPT-5.2果然反超谷歌Gemini 3 Pro!北大数院校友核心贡献

OpenAI在成立十周年推出GPT - 5.2,相比GPT - 5.1在多实用领域更强,视觉理解等能力提升。ARC - AGI测试中得分超谷歌Gemini 3 Pro。拆解其多方面能力,还介绍核心团队多为数学专业新面孔。

量子位
新闻资讯7

深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难的23道题

OpenAI发布会上称GPT-5代码能力全球第一,其在SWE-bench Verified基准获74.9%通过率,略高于Claude Opus 4.1的74.5%。但OpenAI未做23道难题,若计入,GPT-5实际通过率或低于Claude。

新智元
产品应用8

国产Deep Research杀出一匹「裸奔」黑马:免费开放,过程透明,网页报告一键即出

国产AI搜索秘塔AI搜索放大招,深度研究功能发布即免费公开,自带新玩法,思考过程透明。在评测集上表现优,可应对复杂问题,生成规范报告,还能转互动网页,严谨度与易用性兼备。

量子位
开源动态8

小红书开源大模型dots.llm1,初次出手,小有惊艳!国外网友们又炸了……

小红书hi lab团队公布首个开源大模型dots.llm1,这是142B参数的MoE模型,仅14B激活参数就能与Qwen2.5 - 72B打平。它开源力度大,训练效率高,数据处理精细,训练稳定,获国外网友高度关注。

AGI Hunt
算法论文8

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术发展迅速,现有检测方法难满足需求。最新综述提出「事实保真度验证」目标,梳理出视觉与语言双视角的四层检测框架,还分析了检测方法演进、评测指标和数据集,为AI视频检测提供落地地图。

新智元
推荐文章7

重新思考 AI TCO:为何每 Token 成本才是唯一重要的指标

在生成式与代理式AI时代,传统数据中心转变为AI Token工厂,企业评估AI基础设施时不应只关注算力成本、每美元FLOPS,而应重视每Token成本,它决定AI规模化盈利,NVIDIA在该指标上表现出色。

AI前线
开源动态8

让大模型理解真实医疗视频,全球首个开源技术方案来了!

AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解大模型元智医疗视频理解大模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。

机器之心
新闻资讯7

独家 | 华为19级天才少年赵立晨离职创业,瞄准具身 Agentic OS

AI科技评论独家获悉,前华为天才少年、19级技术专家赵立晨2026年3月离职,加入杭州拉格朗日具身技术有限公司。该公司聚焦具身智能架构研发与硬件规模化落地,赵立晨想做的Agentic OS是具身产业化的基础设施。

AI科技评论
新闻资讯8

“养虾”热潮下,专家帮你拆解Agent如何重写软件逻辑 | 奇点智能技术大会首日精彩回顾

2026 奇点智能技术大会聚焦 AI 发展新趋势,探讨 Agent 对软件与互联网产业的重构。会上发布白皮书、评测榜单,成立开发者社区,多位专家分享见解,涉及 AI 研发、模型协同、大模型演进及科学多模态模型等内容。

AI科技大本营