「人工干预机制」共找到 1105 篇相关文章
超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发
斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在多基准测试中超越Claude Mythos和GPT - 5.5。
OpenAI发布GPT-5.4:首个原生接管电脑通用模型
OpenAI发布GPT-5.4及满血版GPT-5.4 Pro,主打专业生产力。它具备原生电脑操作能力,视觉感知、职场任务表现提升,幻觉问题被压制,代码能力强,工具调用机制优化,已在ChatGPT等全量上线,API定价上调。
震撼!0人类,16个Claude全自主开发,2万美元十万行代码成功运行Linux
Anthropic研究员用Claude Opus 4.6智能体团队自主编写超十万行代码的C语言编译器,能运行《毁灭战士》、编译Linux内核。团队用拉夫循环等机制让Claude自主开发,虽有局限但全自动软件开发时代已提前降临。
杨植麟回复:Kimi K2训练用的H800!但“只花了460万美元”嘛…
月之暗面团队回应Kimi K2 Thinking训练成本,透露用英伟达H800,GPU少但利用充分。该模型凭实力与低成本引迁移潮,还引发对闭源巨头估值反思。技术上有优化创新,团队还公开答疑。
NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据集
港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还可优化现有数据集。实验显示其在多基准任务上性能提升显著,可扩展性佳。
前百川联创下场、字节腾讯入局,到底谁在看好 AI 播客?
近期前百川智能联创焦可的‘来福’、前妙鸭相机产品负责人张月光的 ChatPods 等 AI 播客产品上线。‘来福’播客全由 AI 生成,国内多款同类产品也相继登场。虽产品效果能达及格线,但在多数播客场景难替代现有内容。
ICCV 2025 | EPD-Solver:西湖大学发布并行加速扩散采样算法
扩散模型成生成任务主流技术,但逐步去噪机制致推理延迟大。西湖大学提出 EPD - Solver 算法,融合三类加速思路优势,可减少积分误差、提升生成质量,还能作插件集成,突破扩散模型速度与质量权衡瓶颈。
大模型能力,小模型成本!Google等 | 提出递归混合框架:MoR, 大幅提升LLM计算效率
Google提出递归混合框架(MoR),融合参数共享与自适应计算。它有轻量级路由和KV缓存策略,在不同路由机制各有优劣。实验显示,MoR在性能、计算和内存效率上表现出色,有望实现“大模型能力,小模型成本”。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
Granola:ChatGPT、Notion 都入场的 AI 纪要,能真正沉淀工作流吗?
AI 发展带动大量 AI 纪要工具兴起,Granola 凭借新颖 AI 交互方式和对 AI 产品的深入思考,成为领域后起之秀。它提供 AI 补充人工笔记功能,改变了很多知识工作者工作流,但也面临用户习惯和大模型公司切入等挑战。