学术基准测试」共找到 2189 篇相关文章

开源动态8

蚂蚁Ring-1T正式登场,万亿参数思考模型,数学能力对标IMO银牌

10月14日凌晨,蚂蚁万亿级思考模型Ring-1T正式登场,这是全球首个开源的万亿参数思考模型。它在多项基准测试中表现出色,数学能力达IMO银牌水平,还展示了强大的代码、推理、写作等能力,其背后是IcePop算法与ASystem框架的支撑。

机器之心
新闻资讯7

Sora 2 惊现 LLM 推理能力,视频生成模型也能搞推理?

Sora 2在科学推理基准测试中获55%成绩,虽不敌GPT - 5,但一个视频生成模型能做推理令人惊讶。Epoch AI实验发现其可能借LLM重写提示词答题,网友也证实背后或有GPT - 4o等处理。此外,Google研究显示视频模型经大量训练或有推理能力。

AGI Hunt
开源动态7

开源AI黑客Agent,自动检查代码漏洞并修复,离AI编程的全流程自动化不远了。

开源的AI Agent能自动查代码漏洞并修复,是集自动化渗透等功能于一体的安全测试平台。Strix作为开源AI安全测试工具,无需手动渗透测试,支持多类型安全评估,功能强大。

开源AI项目落地
产品应用8

把 MiniMax M2.7 扔进真实业务里:它替我省了 BI 和程序员的钱

作者测试 MiniMax M2.7,用含复杂数据的 Excel 测试其办公能力,让其开发管理系统验证工程能力,还测试 MaxClaw 多步骤 Agent。结果显示它表现出色,但处理复杂事件仍待优化。

InfoQ
新闻资讯8

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子

ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。

新智元
开源动态7

一键部署,100+安全工具,一句话就能打靶!

网络系统复杂,传统渗透测试繁琐低效。开源项目CyberStrikeAI基于Golang开发,集成100+安全工具,通过自然语言对话让安全测试变简单,在GitHub获2.6K+ Star,优势显著。

开源先锋
新闻资讯7

突发!NeurIPS拒收这类论文,AI学者集体破防

NeurIPS 2026新规拒收受制裁机构论文,引发中国AI学术圈震动,该规则指向OFAC制裁名单。同时,ICML 2026审稿口碑崩盘,评审意见放出后OpenReview宕机,审稿质量遭大量吐槽。

新智元
算法论文8

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。

机器之心
算法论文8

具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统

香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。

机器之心
开源动态8

Google刚刚开源的一款AI工具,Gemini 2.5驱动浏览器自动化!

Google在GitHub开源AI浏览器自动化工具Computer Use Preview,基于Gemini 2.5模型,用自然语言控制浏览器完成复杂任务。支持双环境,集成Gemini API/Vertex AI,适用于Web测试等,零代码入门。

开源星探