置信度校准」共找到 355 篇相关文章

推荐文章7

Harness Engineering 为什么是 Agent 时代的“控制论”?

本文是 George Zhang 对 Harness engineering 的解读。OpenAI 提出新工作方式,让 agent 编码,引发讨论。从瓦特调速器到 Kubernetes 再到如今的 harness engineering,本质都是控制论模式。LLM 或使代码库反馈回路在关键决策层闭合,但校准传感器和执行器是难题。

海外独角兽
算法论文8

告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍

视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅,为VLA模型部署提供新方案。

机器之心
推荐文章7

先说个暴论:不懂代码的人,才最喜欢 Vibe Coding。

文章指出不懂代码的人爱Vibe Coding,还介绍AI Coding赛道跨行、跨文件补全方向。分析基于AST的上下文构造、提升速的方法,提及AI IDE采纳率问题,认为实际项目中NES可控更高。

探索AGI
算法论文7

OpenAI谈:大模型为什么会有幻觉?如何避免?

OpenAI论文探讨大模型幻觉问题,指出评测缺陷,像多数AI模型评测非对即错,模型为得分会瞎猜。还从预训练和后训练阶段剖析根源,提议改造评测,引入置信阈值和错误惩罚机制。

探索AGI
新闻资讯8

Cursor 套壳、Cloudflare 上架、老黄邀请,中国模型杀进了硅谷的 AI 供应链

3月19日,Cursor发布新模型Composer 2,后被发现底层基于中国Kimi开源模型K2.5微调。此外,Cloudflare将K2.5上架到边缘计算平台,成本降77%;黄仁勋邀Kimi创始人演讲;马斯克两点赞Kimi。

Founder Park
新闻资讯8

刚刚,英伟达新模型上线!4B推理狂飙53倍,全新注意力架构超越Mamba 2

Jet - Nemotron是英伟达推出的小模型系列(2B/4B),由全华人团队打造。其提出PostNAS与JetBlock,实现架构优化。相比Qwen3等模型,它在多维准确率更高,H100 GPU上推理吞吐量最高提升53倍。

新智元
算法论文8

让大模型上车:理想汽车硬件协同设计算出最佳边缘模型

长三角洲AI实验室、中科院、理想汽车等找到大语言模型硬件协同设计寻优之路,在相同延迟下降低端侧模型困惑,压缩模型架构挑选时间。研究揭示缩放定律,打造硬件感知建模框架,找到精与延迟最优解。

AIGC开放社区
8

高通祭出全球最快移动SoC!卢伟冰携全球首发小米17Pro现身

2025骁龙峰会·中国会场,高通推出第五代骁龙8至尊版移动平台,采用台积电3nm制程。小米17系列将全球首发,多家厂商也会搭载。该芯片在CPU、GPU、NPU等多维性能提升,还在影像、音频和通信方面有飞跃。

机器之心
开源动态8

最新智能体自动操作手机电脑,10个榜单开源SOTA全拿下|通义实验室

通义实验室推出Mobile - Agent - v3智能体框架,在多核心榜单获开源最佳。它能完成复杂任务,在多智能体框架中灵活切换角色。团队搭建云环境基建,从多维构建数据,用强化学习和多智能体协作提升其性能。

量子位
推荐文章7

图解Vllm V1系列5:调器策略(Scheduler)

本文是图解Vllm V1系列5,聚焦调器策略。先回顾vllm v1整体运作流程,接着阐述调 - 推理的整体流程,包括将请求添加进Scheduler、Scheduler单步调策略等,还对比了不同场景下的函数及调逻辑。

GiantPandaLLM