「性能验证」共找到 2605 篇相关文章
我收集了 12 条技术社区疯传的 Claude Prompt,如今这篇帖子火遍全网
近日一篇关于Claude提示词的整理帖在海外技术社区走红。发帖者汇总了‘被反复验证有效’的Claude Prompt,清单中的提示聚焦质疑、拆解等认知工作,InfoQ翻译整理了12条供参考。
SGLang原生支持昇腾,新模型一键拉起无需改代码
12月20日SGLang AI金融π对收官,聚焦大模型推理效率。昇腾成SGLang原生支持后端,助DeepSeek等模型免调参运行。SGLang给出推理系统工程解法,昇腾与SGLang深度共建,性能优且全面拥抱开源。
智谱GLM-5强调的Agentic Engineering能力是什么?|甲子光年
智谱上线并开源GLM - 5,在Coding与Agent能力上达开源SOTA,刺激股价上涨。它验证了Agentic Engineering可行性,提升能力阈值,但成本阈值也更显性,未来软件工程或分层发展。
让机器人学会“预判接触”:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题
它石智航联合四大顶尖机构发布论文“TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人能提前预判接触变化,在精细操作领域取得关键进展。
AI写CUDA算子准确率92%,到国产芯片只剩4%?上交方法直线拉升,DeepSeek也适用
GPT-5.2写CUDA算子正确率92%,给华为Ascend NPU写算子仅4%,因公开数据少等致‘新硬件冷启动’难。上海交大团队EvoKernel不训新模型、不标新数据,将GPT-5.2正确率从4%拉到83%,还拓展到DeepSeek架构算子。
老黄新鲜一刀,RTX 5050正式官宣
英伟达官宣RTX 5050桌面/笔记本GPU,7月上市,国内2099元起。它搭配DLSS 4技术,性能提升显著,但显存“新旧混搭”。网友大多不太买账,认为能耗高、性价比低。
ICLR最佳论文:Transformer天生简洁
2026年ICLR最佳论文对Transformer做深度思维体检,指出其架构真正威力在于描述概念时比RNN等简洁指数级甚至双重指数级,但验证其内部逻辑计算成本高昂,为解释其能力开新窗。
开源多模态推理「破壁」时刻:MMFineReason助力4B逆袭30B
长期以来,开源多模态模型在复杂推理任务上与顶尖闭源模型有差距,核心痛点是高质量推理数据匮乏。上海AI实验室OpenDataLab团队开源MMFineReason框架及大规模数据集,小模型凭此实现性能逆袭。
Veo何止生成视频:DeepMind正在用它模拟整个机器人世界
通用型机器人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机器人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。
庞若鸣还有苹果论文?改善预训练高质量数据枯竭困境
苹果基础模型原负责人庞若鸣在 Meta 任职期间,其在苹果参与的高价值研究仍不断发表。研究团队针对大模型训练中高质量数据枯竭问题,提出 Synthetic Bootstrapped Pretraining (SBP) 预训练流程,提升模型性能。