「非马尔可夫任务」共找到 2548 篇相关文章
时间会证明光的
市场曾质疑AI资本开支高增长的持续性,如今随着头部模型公司ARR非线性爆发式增长,AI商业正向循环打通。在AI硬件产业链中,光互联是国内厂商全球参与度最高、份额最稳固的环节,正迎来最好时代。
人形机器人设计正在向仿真器低头!40年机器人从业老兵发出警告
人形机器人行业现怪象,为让仿真系统和强化学习更顺,一些有机械优势的结构因‘仿真麻烦’被排除。40多年经验的Scott Walter质疑设计变得‘S.T.U.P.P.I.D.’,指出仿真应服务设计而非主宰。
Opus 4.5之后,AI正在催生“巨头型百人公司”
Opus 4.5发布后,Agent赛道洗牌,模型差距由Agent Loop拉开。本文围绕Cherry Studio,与创始人及投资人探讨AI公司护城河、开源意义、用户价值差异等,指出未来将催生“巨头型百人公司”。
亚马逊云科技 AI 助手终于来了,一出手就对标 Cowork
亚马逊云科技推出 AI 助手 Amazon Quick,对标 Claude Cowork。它是 AI 驱动的桌面办公助手,可通过自然语言完成多项办公任务,还能连接多种办公工具,在国内使用体验好,体现了 AI 办公从‘工具增强’走向‘流程重构’。
ICML 2026 | 大模型内部也会长出「情绪树」,规模越大越懂人心
ICML2026 论文指出,大语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型越大,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。
把视频变成图文博客:Agent + 豆包 Seed2.0 lite 重做 Karpathy 两年前的工作流
本文以重做 Karpathy 两年前工作流为例,介绍用 Agent + 豆包 Seed2.0 lite 将视频转为图文博客的方法。详述四步流程,指出其局限,还说明该模式可用于竞品直播追踪、在线课堂报告、游戏赛后复盘等场景。
GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」
大模型推理能力难迁移到小模型,现有强化学习方法如GRPO在小模型上性能提升有限。香港中文大学(深圳)唐晓莹教授团队提出G²RPO - A算法,缓解小模型奖励稀疏问题,在多模型实验中表现优于vanilla GRPO。
Anthropic最新论文:检测LLM内省意识的方法
Anthropic与MIT等研究表明,LLM能‘感知’被注入的steering vector,‘内省意识’在DPO等后训练阶段涌现。研究构建实验,发现内省能力行为稳健、检测非简单线性关联等,还揭示检测与识别机制不同及两阶段电路。
Tank OS:红帽首席工程师把OpenClaw打包成可启动的Linux设备
红帽首席软件工程师Sally O'Malley在GitHub发布开源工具Tank OS,它用bootc技术将Fedora Linux和OpenClaw打包成可启动容器镜像。该工具解决OpenClaw配置安全问题,适合企业环境,虽非面向小白,但对企业IT重要。
你不知道的 Agent:原理、架构与工程实践
文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。