M4DocBench」共找到 1643 篇相关文章

算法论文8

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。

机器之心
新闻资讯8

【AAAI 2026大会特邀报告】从推理到科学发现:AI迈向可精专通才之路

上海人工智能实验室周伯文在AAAI 2026大会提出,当前处于AGI前夕,需通专融合智能。他认为可深度专业化通用模型是实现AGI的可行路径,科学发现是AI前沿,还介绍了SAGE架构及相关成果。

OpenMMLab
新闻资讯7

Gemini 3.8,明日登场!

最新爆料,Gemini 3.8 Flash明日登场,谷歌已放弃Gemini 3.5 Pro。其编程实力强悍,之前还为Gemini植入智能体视频理解功能,降本提效,可应对多种高难度场景。近期多家AI发布计划撞车,混战升级。

新智元
新闻资讯8

逼近5万亿美元!英伟达GTC深夜爆拉市值,Vera Rubin超级芯片首露面

昨夜英伟达GTC大会上,黄仁勋演讲后股价涨4.98%,市值增2300多亿美元达4.89万亿逼近5万亿。他介绍了Vera Rubin超级芯片等,还宣布多项技术成果,如AI原生6G协议栈、NVQLink等。

机器之心
推荐文章7

AI们数不清六根手指,这事没那么简单。

作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。

数字生命卡兹克
产品应用7

Apple 终于承认了:Mac mini 正在变成一台 Agent 服务器

苹果偷摸发布新 Mac mini,处理器升级到 M6 和 M5 Pro,官方将其置于 Agent 常驻使用场景,产品边界向 Agent 服务器延展。新款性能提升显著,Mac Studio 也有强大配置,Apple 产品线朝本地 AI 计算基础设施转变。

MacTalk
新闻资讯7

Qwen 3-235B Aider编程能力击败Claude3.7,成本便宜百倍

Qwen3-235B-A22B在Aider多语言编码基准初步测试中击败Sonnet 3.7 Thinking和OpenAI o1,成本便宜150到600倍。Qwen3-32B准确率超GPT-4.5和GPT-4o ,代码编辑格式正确率达100%。

AI寒武纪
产品应用7

Cursor发布Composer 2:专攻代码的模型,价格只有GPT-5的零头

Cursor本周发布自研编程模型Composer 2,只攻代码生成。其得分提升,超Claude Opus 4.6,接近GPT - 5.4 Thinking。训练基于代码数据,处理复杂编程任务准确度高,价格远低于竞品。这是Cursor全栈布局,欲掌握AI编程主动权。

AI工程化
推荐文章7

AI 味的原因找到了,都是 NTJ 惹的祸

作者因常被说说话像AI,好奇大模型MBTI类型。实验发现Claude - 4、Gemini - 2.5 - pro、GPT - 4为INTJ,DeepSeek是ENTJ。分析了大模型呈现NTJ特质的原因、AI味根源,还给出让大模型有情感的思路和使用技巧。

特工宇宙
开源动态8

sgl-kernel MoE Align Block Size Kernel 优化过程解析

文章记录SGLang的sgl-kernel中优化 `moe_align_kernel.cu` 的过程。MoE模型的 `moe_align_block_size` kernel从最初的baseline版本经多次迭代,包括加向量化padding、用Blelloch Scan并行化前缀和、用Warp Scan减少同步开销等。

GiantPandaLLM