基准测试平台」共找到 3298 篇相关文章

开源动态8

本周 5 个超酷 GitHub 开源项目,实用到飞起!

本文介绍本周5个超酷GitHub开源项目。有显示苹果设备电池状态的AirBattery,开源卫星可视化平台keeptrack.space,本地图片压缩工具Pic - Smaller,跨平台端口助手Port - Killer,轻量级AI证件照工具HivisionIDPhotos。

开源先锋
新闻资讯7

AI 正在毁掉开源:从“协作圣地”到“垃圾洪水”,维护者士气跌至谷底,开始集体掀桌

AI Slop正破坏开源开发中维护者与贡献者的社会契约,贡献数量使系统不堪重负。文章探讨AI Slop时代开源现状、维护者应对方式,还提及基金会政策、极端选项、激励问题,并给出最终建议。

InfoQ
产品应用7

Human In the Loop竟然可以是个MCP?

文章基于阿里实践,阐述如何在大模型研发平台OpenLM及其他Agent平台,针对“Human In The Loop”场景做产品设计与研发。介绍用MCP实现人机回路的方案,还探讨人类回答及提示词倾向性等问题。

阿里云开发者
开源动态8

空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没

上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。

机器之心
新闻资讯7

GPT-5.2发布,真正的牛马打工人专属AI来了。

OpenAI十周年凌晨2点发布GPT - 5.2。它在部分跑分上提升不大,但在ARC - AGI - 2和GDPval评测集表现亮眼,上下文处理能力也大幅加强。将开放给会员使用,价格比5.1贵。

数字生命卡兹克
产品应用8

阿里“悟空”上线!钉钉给企业送来龙虾大军

AI钉钉2.0年度新品发布会上,阿里发布AI toB旗舰应用“悟空WuKong”,它以企业智能体为核心,能落地办公场景。悟空开启全球邀测,也会内置到钉钉AI 2.0。它还带来行业解决方案,补齐安全短板。

量子位
产品应用8

这个 Agent Team,终于不是"角色扮演"了

作者测试了 MiniMax 新出的 Agent Team,通过深度研究公司、整理会议逐字稿、做直播数据分析三个测试,展现其优势。指出 Agent Team 核心是对抗式质量门禁,是复杂任务兜底系统,而非简单 prompt 编排。

AI产品黄叔
算法论文8

ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则

这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准

深度学习自然语言处理
开源动态8

刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking

美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的大语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。

AGI Hunt
算法论文8

伯克利斯坦福联手造出「科研预言家」:77%准确率押注研究想法前景

伯克利和斯坦福团队让GPT - 4.1变身「科研预言家」,从顶会提取想法对比案例训练,不借助实验验证,靠推理押注。其在公开题库测试、人类专家团战等测试中表现出色,还能预测AI新点子。

深度学习自然语言处理