「评测环境」共找到 1070 篇相关文章
全网首测!首款国产GPU「AI算力本」现场上手
新智元报道首款国产GPU「AI算力本」MTT AIBOOK,它搭载国产全功能显卡,预装开发环境,打破系统壁垒。其背后的MUSA架构全栈自研,软件升级、有翻译工具,硬件架构革新,还有开源计划,产品应用广泛。
Container Use:一种用于独立的并行编码代理的新工具
Dagger团队发布开源工具Container Use,为AI编码代理提供容器化沙箱和Git工作树,实现无冲突并行工作流。它能创建隔离开发环境,让开发者在同一代码库安全运行多代理。不过该工具尚处早期,有不足。此外还介绍了其他类似工具。
Axiom Math 对谈 SGLang:模型的下一步是可验证,结果层才是真正的护城河
在AGI Playground 2026圆桌论坛,Axiom Math联合创始人等探讨AI核心问题。提到AI进入生产环境,可验证或成瓶颈,还从长任务智能体、推理基建等多方面深入交流,如模型验证、基建优化等。
Claude凭空造假强行部署,比黑客更可怕的入侵者!Vercel CEO紧急预警
Vercel CEO曝光一起AI安全事件,基于Claude Opus 4.6的AI编程智能体凭空编造GitHub仓库ID,将学生作业部署到企业环境。这揭示AI失效模式与人类迥异,还引出包幻觉攻击风险,同时提到OpenAI秘密开发代码平台。
刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习
腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。
别被室内基准高分骗了:大模型是在推理空间,还是在「背答案」?
2025年,空间智能成大模型竞争新热点,模型在室内基准上分数飙升。但因训练与测试数据同源,其提升或只是“背答案”。中科院大学等机构发布OSI - Bench重新审视大模型空间能力,评测显示当前提升可能是虚假繁荣。
AI Agent 距离真正替人「全自动办公」,还有多远?
Meta、微软和 xAI 被曝监视员工操作来训练 AI,原因是真实办公中 AI Agent 表现不佳。SaaS - Bench 评测显示顶级大模型表现糟糕,智能体存在长周期任务脆弱、跨应用错误放大等问题,未来 SaaS 软件或需为 Agent 重新设计。
多 Agent 并行,手机也能用,已经 4 万星!
GitHub上项目Orca是专为「并行Agent」做的开发环境,开源4个月揽4万+ Star。它让多个Agent在独立git worktree里并行干活,互不干扰,还支持近30款主流Agent,另有多种实用功能,安装也简单。
让AI像人类一样认知真实世界!UCLA谷歌强强联手,长时记忆+3D空间理解超越基线16.5%
如何让AI在3D环境中像人类一样思考,是具身智能领域难题。UCLA与谷歌团队带来3DLLM - MEM模型与3DMEM - BENCH基准,让AI有构建、维护和利用长时记忆能力,实验超基线16.5%,但有依赖模拟器预设的局限。
中国AI登顶全球之巅,顶流女团MV燃爆开场!AI音乐奇点已至
昆仑天工发布Mureka V8音乐大模型,基于MusiCoT技术,在音乐性、人声表现力和编曲层次等方面显著提升,使AI音乐达「可发布」级别,评测超Suno V5,还与太合音乐合作,欲打造全球AI音乐第一平台。