无门控测试」共找到 2271 篇相关文章

开源动态8

让AI自动构建AI模型:UCSD 推出 AIBuildAI 智能体,斩获OpenAI MLE-Bench榜单第一

近日,加州大学圣地亚哥分校研究团队开发 AIBuildAI 智能体,可全自动构建 AI 模型。它在 OpenAI MLE - Bench 基准测试 75 个任务上以 63.1% 获奖率居榜首,实现端到端自动化。

机器之心
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
新闻资讯7

Cloudflare 推出 Meerkat,实现全球强一致性协调

Cloudflare推出基于QuePaxa共识算法的Meerkat服务,可领导者写入并保持强一致性,提升网络可用性。虽有往返通信代价且非通用数据系统,但优化对强一致性系统重要,还未投入生产。

InfoQ
开源动态8

Insanely Fast Whisper:开源社区让音频转录速度提升19倍

Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。

AI工程化
新闻资讯7

DeepSeek 推出快速模式和专家模式

DeepSeek web 端灰度测试快速模式和专家模式,快速模式用于日常会话,专家模式适合复杂任务,但不支持文件上传,上下文仅 128k。目前两模式能力与 v3.2 没差别,或为 v4 做准备。

AI寒武纪
新闻资讯7

为了活到120岁,硅谷富豪们正在把自己变成小白鼠

硅谷富豪为活到120岁,用‘生物黑客’手段抗衰,如服雷帕霉素、尝试血浆疗法等。科研人员警告,这些技术未临床测试,效果和安全性未知。同时,长寿科技成资本热门,不同公司有不同路径。

DeepTech深科技
产品应用8

Claude Code用不了?我给你开发了一个GLM Code

Claude Code虽好用,但存在订阅难、易封号、配置麻烦等问题。作者开发了GLM Code,一行命令就能用,安装简单、价格便宜、封号风险,能力达Claude 90%,还给出使用步骤、适用人群等信息。

花叔
开源动态8

AI 本地跑?Google 新开源模型上线,本地量化后占用不到 200MB 内存,支持百余语言

Google DeepMind推出开源嵌入模型EmbeddingGemma,专为本地设备高效运行设计。它用Matryoshka方法和量化感知训练,提升效率。在MTEB测试中成绩佳,支持百余种语言,内存占用少,已集成多种工具。

InfoQ
新闻资讯8

字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军

字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。

AGI Hunt
新闻资讯7

奥特曼爆冷改口:AGI没用?MIT预测2028年降临,50%概率

我们越来越接近AGI,时间表从50年缩到5年,大佬预测2026、2028年降临。但AI在ARC测试得分0%,人类基本能力似新手。算力战已打响,AGI或需架构革命和技术集体转向。

新智元