「基准测试成本」共找到 3406 篇相关文章
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
亲历两场编程语言迁移“惨案”,谷歌大佬揭露技术选型真相:90%决策与技术无关
谷歌大佬 Steve Francia 结合自身经历,指出技术选型常受身份认同等非技术因素影响。如早期创业公司因 CTO 执意换语言错失市场,谷歌团队跟风选 Rust。还分析了背后原因及代价,并给出破局建议。
谷歌首次曝光太空AI计划:要建“AI版星链”,AGI的终极基础设施?
谷歌曝光Project Suncatcher计划,要构建太空AI计算集群。此设想是部署卫星星座建“太空数据中心”。虽面临诸多挑战,但从物理学和经济可行性看并非遥不可及,谷歌已发表相关预印本论文。
华为Doc-Researcher 布局感知+视觉语义双杀
现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。
为什么软件工程治理很重要:降低风险但不拖累速度
Sarah Wells 在哥本哈根 Goto 会议称,软件工程治理助团队决策、支持价值交付。糟糕治理会拖慢进度、增加成本。技术策略和组织技术雷达可辅助决策,还能从 DORA 能力学治理。
谷歌推出 LLM-Evalkit,为提示词工程带来秩序与可衡量性
谷歌推出基于 Vertex AI SDK 的开源框架 LLM - Evalkit,让大语言模型提示词工程更有序可衡量。它整合实验、测试等环节,与谷歌云工作流集成,有无代码界面,已在 GitHub 发布。
NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍
自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。
vLLM 新特性:批量大小不再影响模型输出
vLLM 推出批量不变推理功能,解决大模型推理中相同输入在不同批量大小下结果不同的问题。设置 `VLLM_BATCH_INVARIANT=1` 可保证输出一致,技术实现含三部分,虽有性能开销但换来了结果确定性。
一个指令误导智能模型!北航等首创3D语义攻击框架,成功率暴涨119%
北京航空航天大学与中关村实验室团队提出全新框架InSUR,入选NeurIPS 2025。该框架可基于指令生成对抗样本,首次实现3D SemanticAE生成,从采样、建模、评估三方面突破,实验验证其有效性与可扩展性。
AI模型守法率提升11%,港科大首次用法案构建安全benchmark
香港科技大学KnowComp实验室从法律合规视角研究LLM安全,提出「安全合规」新范式。基于法律条文构建benchmark,用GRPO微调Qwen3 - 8B得推理模型,在新benchmark测试中性能提升显著。