「置信度指标」共找到 600 篇相关文章
具身智能:当钱成为记分牌,重资产开始翻盘
2026 年上半年具身智能赛道火热,超 460 亿资金涌入,25 家成百亿独角兽。融资额成竞争指标,虽行业长期需求真实,但短期估值与技术有缺口,热潮或催熟相关技术和供应链。
人生周报v022:十层认知
文章围绕育儿量化指标、写提示词的难点、培训出路、AI生成PPT的局限、MCP协议误区等多个话题展开讨论,还推荐了物理科普书《解析物理的十层之旅》。
从科学论文自动生成视频
该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。
规范对齐:回答前的深思,让安全与行为边界更清晰
OpenAI等厂商将规范融入大模型。上海交大等团队提出规范对齐概念,构建评测基准SpecBench,揭示主流模型不足。探索测试时深思方法,如Align3,能提升模型规范遵循度,项目已开源。
其实,扩散语言模型在最终解码之前很久,就已确定最终答案
随着扩散语言模型(DLM)发展,它成自回归(AR)模型有力替代。但实际推理慢于 AR 模型。研究者发现早期答案收敛现象,提出 Prophet 策略,实验显示其能在保持高质量生成时显著加速推理。
ICCV 2025 | RobustSplat: 解耦致密化与动态的抗瞬态3DGS三维重建
3DGS技术成研究热点,但现有方法在含动态物体场景建模精度不足。中山大学等研究者提出RobustSplat,有延迟高斯生长和尺度级联掩码引导两大核心设计,实验显示其在多指标上领先基线方法。
刚刚,美团开源全模态龙猫模型,和 ChatGPT 大战 100 回合打得难解难分
美团发布开源全模态 MoE 模型 LongCat-Flash-Omni,参数 560B 激活 27B。它有真正全模态能力,采用创新架构和训练范式,基准测试表现亮眼,部分指标超 Gemini-2.5-Flash,引发网友热议。
在场Vol.6 |《牛来》:粗糙什么时候能成为一种风格?
本期《在场》观察动画电影《牛来》,它因“粗糙”引热议,观众边吐槽边截图讨论其色彩与构图。文章借这一现象探讨“粗糙”与“风格”区别,还结合艺术史和AI时代分析作品完成度与风格的关系。
OpenClaw爆火,暴露12类致命隐患!MCP协议安全基准发布 | ICLR
OpenClaw等开源AI Agent项目爆火,MCP协议拓宽其能力也增大攻击面。北京邮电大学团队推出MSB安全基准,揭示MCP各阶段攻击有效,性能强的模型更易受攻击,还提出NRP指标平衡安全与实用性。
Google 在 AI 竞赛中如何从落后到反超的故事
本文讲述 Google 在 AI 竞赛中从落后到反超的历程。曾因傲慢错过先机,ChatGPT 问世后 Google 陷入恐慌,后通过创始人回归、团队合并、召回人才等举措,让 Gemini 模型多项指标超越 ChatGPT,实现逆袭。