基准测试平台」共找到 3273 篇相关文章

开源动态8

开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4

上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。

量子位
新闻资讯7

7个AI玩狼人杀,GPT-5获断崖式MVP,Kimi手段激进

OpenAI总裁转发基准测试,让7个LLMs玩210场狼人杀。GPT - 5胜率96.7%断崖式领先,国产Qwen3和Kimi - K2分列第4、6。测试方分析模型性格,还借此研究LLMs社会行为,长远目标是实现AI驱动的市场研究。

量子位
开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
新闻资讯7

Docker 通过 Cagent 提供 AI 代理确定性测试

AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。

InfoQ
开源动态8

我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准

在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。

机器之心
开源动态8

Insanely Fast Whisper:开源社区让音频转录速度提升19倍

Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。

AI工程化
开源动态8

万帧实时!流式3D重建天花板,被国产开源模型打破了

蚂蚁正式开源 LingBot-Map,这是基于几何上下文 Transformer 的纯自回归流式 3D 重建基础模型。它能在恒定内存下实现超万帧长视频实时三维重建,处理速度约 20 FPS,在多基准测试中超越现有流式方法。

机器之心
新闻资讯7

刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4

LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。

机器之心
产品应用7

CAI+DeepSeek渗透测试情况及扩展分析

文章对CAI+DeepSeek进行渗透测试。介绍CAI安装,在kali按Ubuntu指令装,使用界面友好。测试中CAI执行指令彻底灵活,扫描分析到位。还提及CAI多种能力,称其作为开源框架全面细致,值得研究。

AI与安全
新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化