「评测维度」共找到 797 篇相关文章
深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难的23道题
OpenAI发布会上称GPT-5代码能力全球第一,其在SWE-bench Verified基准获74.9%通过率,略高于Claude Opus 4.1的74.5%。但OpenAI未做23道难题,若计入,GPT-5实际通过率或低于Claude。
4D空间智能:AI如何一步步「看懂」时空结构?一篇综述解析通往四维世界的五大层次
4D空间智能重建整合静态场景与时空变化,构建含时间维度的空间表征系统。南洋理工等高校研究者调研该领域,提出按建构深度分五层的新视角,展现AI认知从基础到高阶的进化路径。
国产Deep Research杀出一匹「裸奔」黑马:免费开放,过程透明,网页报告一键即出
国产AI搜索秘塔AI搜索放大招,深度研究功能发布即免费公开,自带新玩法,思考过程透明。在评测集上表现优,可应对复杂问题,生成规范报告,还能转互动网页,严谨度与易用性兼备。
小红书开源大模型dots.llm1,初次出手,小有惊艳!国外网友们又炸了……
小红书hi lab团队公布首个开源大模型dots.llm1,这是142B参数的MoE模型,仅14B激活参数就能与Qwen2.5 - 72B打平。它开源力度大,训练效率高,数据处理精细,训练稳定,获国外网友高度关注。
烧了1万块横测,你用的模型可能掉队了
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26
AI视频生成技术发展迅速,现有检测方法难满足需求。最新综述提出「事实保真度验证」目标,梳理出视觉与语言双视角的四层检测框架,还分析了检测方法演进、评测指标和数据集,为AI视频检测提供落地地图。
人形机器人绕不开的坎:续航问题怎么破?
人形机器人续航问题常被忽视,但它面临电池重量、行走能耗、脉冲负荷三个维度约束,标称续航在实际工况会打折,工程上可通过快速换电和提升单次充电电量应对,固态电池有潜力但有待验证。
让大模型理解真实医疗视频,全球首个开源技术方案来了!
AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解大模型元智医疗视频理解大模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。
“养虾”热潮下,专家帮你拆解Agent如何重写软件逻辑 | 奇点智能技术大会首日精彩回顾
2026 奇点智能技术大会聚焦 AI 发展新趋势,探讨 Agent 对软件与互联网产业的重构。会上发布白皮书、评测榜单,成立开发者社区,多位专家分享见解,涉及 AI 研发、模型协同、大模型演进及科学多模态模型等内容。
SVG性能比肩GPT/Claude,腾讯开源3B模型HiVG,让Token「懂几何」
腾讯混元团队开源仅3B参数的HiVG,它是面向SVG生成的层次化分词框架,减少63.8% token数量,多项指标超越GPT-5.2等闭源模型及8B级开源模型,还在人类评测中表现出色。