「推理评估」共找到 2631 篇相关文章
除了AGI已来和死亡,我们为黄仁勋重磅访谈总结了50条AI最前沿判断
2026年3月23日黄仁勋在播客访谈提出众多前沿判断,如AGI已来,Agent时代开启;智能会成商品,人性才稀缺;推理成本高;合成数据非旁门左道等,还谈及公司架构、算力、供应链等话题。
老黄大出血!OpenAI背刺英伟达,微软自研芯连夜拆掉CUDA护城河?
2026年1月26日微软官宣第二代自研AI芯片Maia 200上线,还推出软件Triton。它塞满SRAM,推理成本更低、效率更高。这让英伟达面临生存危机,AI算力圈也变天,降本成关键。
GPT-5.2 上线!全面超越 Claude Opus4.5 及 Gemimi 3.0 Pro
OpenAI 正式宣布 GPT-5.2 全面上线,一口气推出三个版本。GPT-5.2 Thinking 在推理能力上拉开代差,是 OpenAI 首个达人类专家水平的模型。各版本定位清晰,不同用户使用时间有别。
vLLM 正式支持 PaddleOCR-VL
11月4日,vLLM项目宣布正式支持PaddleOCR-VL模型。该模型专注文档解析,参数量仅0.9B。合作降低部署门槛,推理效率更高,官方还给出部署指南和配置建议,流程快速完成可作榜样。
一份最新具身智能中的世界模型&安全综述
本文分享2篇具身智能世界模型和安全挑战的综述。2025年10月的综述用三维坐标轴整合文献。还介绍世界模型分类、性能表现,围绕自动驾驶与机器人领域分析安全隐患并实证评估。
从 Shopify 构建 Agent 的经验中可以学到的
Shopify 分享构建 Agent 经验,采用主流 Agentic Loop 架构。给出4条打造 AI 智能体核心建议,还指出工具控制在20个内,可用 SubAgent 分摊上下文;用人类标记结果作基准让 LLM 评估 Agent 生成结果。
75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据
Google DeepMind团队开发的DataRater可全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据集效果佳,还能跨模型规模泛化。
打破资源瓶颈!华南理工&北航等推出SEA框架:低资源下实现超强多模态安全对齐
本文介绍北航彭浩团队的 SEA 框架,针对多模态大模型低资源安全对齐难题,用合成嵌入替代真实数据,突破资源瓶颈。还构建 VA - SafetyBench 评估安全风险,实验验证了 SEA 低资源、高泛化优势。
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形
ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。
GPT-5.1 突然发布,用户实测:更像 4o,情商大幅提升
OpenAI 向部分付费用户推送 GPT - 5.1,有即时思考和深度思考两种模式,系统自动匹配。它有八种人格预设,改进不仅在语气,还提升记忆编织等能力,像是补救 GPT - 5 失败,还扩展安全评估。