「AI基准测试」共找到 10939 篇相关文章

新闻资讯7

Anthropic刚刚宣布Claude Sonnet 4支持100万token上下文窗口

Anthropic官方公告,Claude Sonnet 4上下文窗口扩大到100万tokens,是之前5倍。能一次读懂大代码库或多篇论文,可用于代码分析、文档处理等。超20万tokens价格翻倍,现仅对Tier 4用户测试。

AI工程化
产品应用7

用Claude Code搭建工作流

作者原本考虑用n8n搭建工作流,现认为Claude Code的Sub - agents和自定义命令功能搭配MCP工具可满足需求。通过示例演示其工作流搭建,还测试换Kimi K2模型,显示其质量更好。

newtype AI
新闻资讯7

核心团队被谷歌挖角后,Cognition 宣布收购 Windsurf 剩余团队

今日凌晨,29岁华人IOI金牌创始人Scott Wu官宣Cognition AI收购Windsurf。此前谷歌以24亿美元收购其核心团队。虽部分人员出走,但Windsurf产品、业务、数据等仍具价值,Cognition计划整合技术打造生态。

Founder Park
新闻资讯8

清华退休教授余志平谈国产EDA发展之路

余志平教授全程参与“熊猫集成电路CAD系统”研发,获国家科技进步一等奖。他带领团队成立公司深耕垂直领域,推动构建国产EDA生态链。他认为突围要把握“缝隙效应”,还强调用AI辅助科研,培养高素质人才。

芯师爷
算法论文7

The Batch: 845 | 没有理由的“推理”

研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。

DeeplearningAI
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
新闻资讯7

12年首次大改!真有人喜欢苹果的“液态玻璃”吗?至少Flutter 开发者的噩梦开始了

在 WWDC 2025 上,苹果宣布在多操作系统引入‘液态玻璃’新视觉风格,是 12 年来最大 UI 革新。这或成苹果移动端外观重大转变,但也掩盖其 AI 落后现状,还让开发者面临功耗、适配等挑战。

InfoQ
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM
算法论文8

绝对零监督Absolute Zero:类AlphaZero自博弈赋能大模型推理,全新零数据训练范式问世

清华大学 LeapLab 团队等提出全新推理训练范式 Absolute Zero,使大模型实现「自我进化式学习」。基于此范式训练的模型 AZR,在代码生成与数学推理基准任务表现出色,缓解了大模型对人工数据依赖难题。

机器之心
产品应用9

全球端到端语音天梯榜易主:比GPT还强的Gemini 3.8 Live 来了,谷歌实时通话智能

本文介绍谷歌推出的全新Gemini 3.8 Live系列实时语音大模型,该模型登顶全球端到端语音天梯榜,性价比远超OpenAI同类产品,首创双轨架构解决AI思考延迟痛点,已全量上线消费端与开发者端。

AI进修生