「用水」共找到 3322 篇相关文章
TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral
大模型推理评测多只看答案,忽略推理过程。上海多校团队提出TRM,用ME² principle刻画推理质量,DAG-based pairwise evaluation还原结构,训练奖励模型,让推理质量可度量、训练和优化。
Current Robotics 发布 Curr-0:以 Single Policy 实现全身灵巧操作
Current Robotics发布Curr - 0,解决人形机器人移动与操作分离困境。它用Single Policy统一训练,基于HumanEx采集数据,还构建多物理模态交互世界模型,是全栈具身智能基础设施成果。
为什么最有价值的AI讨论总发生在知乎?
AI成全民话题,但网上多是热点复述,真正有价值的理解和方法论沉淀在知乎。知乎答主toyama nao、德里克文、Jeff Tao陶建辉分别作为记录者、探索者和建设者,在AI领域深度探索,推动认知沉淀。
猛涨25k star!一键检测你的电脑能跑哪些大模型!
最近 Github 出现工具 `LLMFit`,用 Rust 编写,能自动检测硬件配置,判断大模型能否流畅运行,推荐最优量化版本和运行模式。有一键硬件检测等特性,安装使用方便,降低本地部署门槛。
企业软件研发AI转型的坐标系:奇点智能研究院发布《AISMM 2026 AI原生软件研发成熟度模型白皮书》
奇点智能研究院发布《AISMM 2026 AI原生软件研发成熟度模型白皮书》。当下模型发展快,但组织转型慢。白皮书构建5×5矩阵,助企业明确自身位置与路径,还剖析软件形态、工程变革等关键内容。
动动嘴写SQL!Codex+终身记忆,OpenAI把查询难度直接归零
2026年初,OpenAI曝光数据分析智能体,将数据查询从「天数级」缩至「分钟级」。它用Codex驱动,有六层上下文架构,能补齐数据语义、沉淀经验记忆,让工程师提问取代手动查表。
分享2篇最新Harness论文,一篇谷歌,一篇微软
在LLM Agent迅速发展的当下,如何为其设计合适的Harness成关键问题。本文分享微软M⋆和谷歌AutoHarness两篇论文,分别从记忆系统和动作约束维度提出自动化的Harness进化方法,并介绍了实验结果。
DeepSeek悄悄更新:Mega MoE、FP4 Indexer来了
昨天下午,DeepSeek 更新了 DeepGEMM 代码库,带来新东西 Mega MoE。它将 MoE 计算流程整合,让数据通信和计算同时发生,提高 GPU 利用率。还尝试组合精度、搞 FP4 indexer 等,是基础设施层重构尝试。
Agent新王诞生!Hermes 7周追上龙虾,中国用户可微信直连
2026年二季度,Hermes Agent成新潮流,由美国Nous Research开源,其GitHub stars数达84.4k。国内云厂商支持部署,手机厂商接入并限免。它原生支持微信,开发者评价高,与OpenClaw双雄并立,正掀起生产力革命。
疯了……Claude 最强风控:验你实名身份证!
Anthropic更新支持文档,宣布在Claude平台引入身份验证机制,目的是防滥用、执行政策和履行义务。验证需有效证件、带摄像头设备,由Persona Identities处理数据。此前OpenAI也有类似机制,这或加剧AI使用人群分化。