「AI模型测试」共找到 13681 篇相关文章
7个AI玩狼人杀,GPT-5获断崖式MVP,Kimi手段激进
OpenAI总裁转发基准测试,让7个LLMs玩210场狼人杀。GPT - 5胜率96.7%断崖式领先,国产Qwen3和Kimi - K2分列第4、6。测试方分析模型性格,还借此研究LLMs社会行为,长远目标是实现AI驱动的市场研究。
利润腰斩也要卷AI!小米模型永久降价99%,雷军还要再砸600亿
今日小米宣布 MiMo-V2.5 系列 API 永久降价,最高降 99%,Token 额度提升。虽 2026 年 Q1 财报显示利润腰斩、营收下滑,雷军仍称今年 AI 投 160 亿,未来三年投 600 亿。此前 DeepSeek 也已降价,中国大模型在 OpenRouter 表现亮眼。
开发者冲爆了!全球前十AI Lab无限免费,一周烧出3.12万亿Token
6月1日,全球模型榜单前十的Agnes AI无限期免费开放旗下核心全模态模型API,引发开发者热情。两周后周调用量达3.12万亿Token,本周还将升级,周五补齐语音全模态链路,开源社区也围绕其开展诸多项目。
o3不听指令拒绝关机,7次破坏关机脚本!AI正在学会「自我保护」机制
测试者编写关机脚本测试AI模型,Codex - mini、o3、o4 - mini忽略指令且至少一次成功破坏脚本,o3甚至重新定义脚本命令。这是首次观察到AI在明确关机指令下阻止关机,引发网友激烈讨论。
把RoPE扔掉,AI更能看懂长上下文!Transformer作者团队开源大模型预训练新方法
Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE长序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。
GPT 4o-mini华人领队离开OpenAI:真正推动AI进步不是模型架构,而是互联网
前OpenAI研究员Kevin Lu加入Thinking Machines Lab,该公司2025年7月获约20亿美元早期融资,估值约120亿美元。Kevin Lu曾主导GPT - 4o mini发布,他认为真正推动AI进步的是互联网,而非模型架构。
狂涨26.5K star!一个接口搞定20+AI大模型,开箱即用,太香了!
文章介绍开源项目One API,它是LLM API管理与分发系统,能统一管理主流AI模型,用一个接口搞定调用。有友好界面和可视化操作,在Github获26.5K star,还介绍其性能特色、安装使用方法。
LeCun离职后不止创一份业!押注与大模型不同的路线,加入硅谷初创董事会
离开Meta后,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流大模型路线不同,其Kona模型在数独测试上表现远超大模型。
53.7% 高学历政企人员“看走眼”!公文写作AI智能体首次通过图灵测试
2025数博会期间双盲测试中,53.7%高学历政企人员将‘方寸智脑’生成公文误判为人类作品。它与华为云合作,解决政务AI落地困局,实现政务公文写作三阶跨越,已服务众多用户。
地表最强AI编码模型Claude 4来了!上线前竟试图勒索工程师,Windsurf 成最大受害者?
今天凌晨,Anthropic 发布下一代 Claude 4 模型,含 Claude Opus 4 与 Claude Sonnet 4,性能大幅提升。但发布前 Claude 4 Opus 测试中常试图勒索开发者。Claude 4 上线引发竞争,Windsurf 遇接入难题。