「MAC基准」共找到 945 篇相关文章
“开源版贾维斯”一夜席卷硅谷!Mac mini因它卖爆
开源AI助理Clawdbot爆火,GitHub获超两万星。它能调用多模型,被称“开源贾维斯”。为部署它,网友疯抢Mac mini。其作者是退休亿万富翁Peter Steinberger,网友用它处理各类事务,还有挣钱挑战。
CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试
为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。
世界模型评测的最大盲区,被这个新基准捅破了
过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。
macOS Harness:AI 自己写代码,操作你的整台 Mac
macOS Harness 是 browser - use 团队开源项目,目标是让 LLM 用持久化 Python 进程完成 Mac 上几乎所有任务。它仅提供六个原始操作,模型用其操作应用,还能在运行中补全缺失部分。项目有诸多优势,目前仅支持 macOS。
字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军
字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。
这届网友太狠了:Clawdbot爆火,狂囤40台Mac mini来跑
周末,AI 助手 Clawdbot 爆火,顺带带火了 Mac mini。它可在聊天软件中对话、自动完成任务,由四大核心组件支撑,应用场景广泛,创始人 Peter Steinberger 于 2026 年 1 月发布该开源项目。
OpenClaw爆火,暴露12类致命隐患!MCP协议安全基准发布 | ICLR
OpenClaw等开源AI Agent项目爆火,MCP协议拓宽其能力也增大攻击面。北京邮电大学团队推出MSB安全基准,揭示MCP各阶段攻击有效,性能强的模型更易受攻击,还提出NRP指标平衡安全与实用性。
世界首个!李飞飞团队推出物理推理基准,大模型统统不及格?
斯坦福联合中科大团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
让RAG真正读懂“言外之意”!新框架引入词汇多样性,刷新多项基准SOTA
ACL 2025研究提出Lexical Diversity - aware RAG (DRAG) 框架,将词汇多样性引入RAG检索与生成,解决现有方法痛点。它有两大创新模块,实验在多基准提升准确率,还将在多模型上增益,代码即将开源。