评测维度」共找到 795 篇相关文章

产品应用8

GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂

为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。

AI寒武纪
开源动态8

小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度

小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。

量子位
开源动态8

标准化3D生成质量榜单来了!首创层次化评价体系,告别“谁的demo更吸睛”主观评估

Hi3DEval团队推出面向3D内容生成的全新层次化自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型。

量子位
新闻资讯7

实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩

Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。

新智元
8

挺意外的,Agent长期记忆潜力被AMemGym挖出来了

论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。

PaperAgent
产品应用7

首个OpenClaw智能体宿主机性能评测报告:单机可稳定运行96路Agent实例

OpenClaw成中小企业AI利器,但企业部署面临效率、并发和安全问题。浪潮信息基于元脑x86服务器完成测试,发布评测报告,该服务器单机可稳定运行96路Agent实例,还支持一键配置、多用户隔离。

AI进修生
产品应用8

一手评测Seedance 1.0 pro,字节首次登顶视频大模型竞技场的大杀器来了。

作者在火山引擎发布会现场,认为视频生成模型Seedance 1.0 pro最酷。从多镜头组合、运动质量、情绪、运镜、物理动态效果、风格化六个维度测评,该模型各方面表现出色,无明显短板,已开放给企业用户,今日在豆包App全量上线。

数字生命卡兹克
算法论文8

南大团队直击大模型高分神话:人类90分,最强模型仅49分

南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。

新智元
开源动态7

AgentIF-OneDay 发布,评估全场景长时复杂任务

红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。

特工宇宙
产品应用8

正式版发布!DeepSeek-V4-Pro-0813

8月13日晚,DeepSeek-V4-Pro-0813正式版发布。此次升级将Agent维度提升至无短板的第一梯队,具备1M+384K长任务能力,接口双兼容,技术创新多。还公布评测对比、价格并发设定,给出实战代码案例与启示。

机器学习AI算法工程