「编程基准」共找到 1887 篇相关文章
火了!刚刚,李飞飞2篇最新文章发布!
AI圈近期被李飞飞两篇重磅文章刷屏,一篇阐述空间智能愿景,指出当前AI缺乏空间智能,其创办的World Labs提出世界模型;另一篇论文揭示当前视频理解基准自欺欺人,还提出新基准VSI - SUPER及预测性感知新范式。
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。
谷歌太壕了!编程Agent大招至简:开源且免费,百万上下文、多模态、MCP全支持
谷歌开源免费的编程Agent Gemini CLI,提供业界最高免费限额,能在终端访问Gemini。其能力多样,涵盖代码理解等,支持百万上下文、多模态和MCP,开源协议为Apache 2.0,还给出安装和使用指引。
AI点外卖哪家强,美团LongCat团队做了个全面评测
美团LongCat团队发布贴近生活场景的大模型智能体评测基准VitaBench,以三大高频生活场景为载体,构建含66个工具的评测环境。评测显示现有智能体与应用需求差距大,该基准已全面开源。
马斯克的好兄弟,卡帕西又双叒出新指南!GPT-5 Pro是AI编程最后防线
在「代码后稀缺时代」,Karpathy分享AI辅助编程体会。他认为不同工具各有优劣,Cursor适合日常开发,Claude Code与Codex能完成大块功能但缺「品味」,GPT - 5 Pro是攻克顽固bug的最后防线。
Stripe x Cursor,硅谷两代“金童”对谈: 未来5年IDE里将不再是代码
本文是 Cursor CEO Michael Truell 和 Stripe CEO Patrick Collison 的深度对谈,讨论了 Stripe 的技术实践、编程的未来。如 LLM 会改变 IDE,未来编程更重需求描述;还提到 Stripe 的技术选型、API 重写计划等。
刚刚,GPT-5 横扫编程奥林匹克,5 小时打穿 12 题!人类最强队伍只能做出11道
2025年国际大学编程竞赛世界总决赛(ICPC)上,GPT - 5和OpenAI实验推理模型5小时解完12道题,超越人类最强队伍。Google DeepMind的Gemini 2.5 Deep Think获10/12。此成绩展示推理系统惊人进步。
刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4
LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。
打破AI能力的惯性评估方式,红杉中国推出全新双轨基准测试xbench|甲子光年
红杉中国推出全新AI基准测试工具xbench,采用双轨评估体系,构建多维度测评数据集,追踪模型理论能力上限与Agent实际落地价值。还采用长青评估机制,首期发布两个核心评估集并给出综合排名,公开后邀各界完善。
GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平
香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。