「原生智能体」共找到 3832 篇相关文章
GPT-5 放弃追求智能上限了?
GPT-5发布,虽借OpenAI名气获流量,但AI科技评论认为其结果令人失望。它推销转向任务性能提升,非基础大模型能力突破。虽成果出色,但也引发对AGI发展的反思,还面临诸多难题。
跨平台智能媒体处理与创作工具箱
pyMediaTools 是基于 PySide6 的跨平台桌面应用,集成媒体批处理和 AI 音视频创作工具。利用 FFmpeg、ElevenLabs 和 Groq API,有格式转换、语音合成等功能,还介绍了安装、配置、打包方法。
Karpathy的软件3.0:Agent的原生世界
OpenAI联合创始人Andrej Karpathy在Sequoia Ascent大会上表示,AI Agent正改变软件与工作模式。编程基本单位从写代码变为给Agent下达指令,软件3.0以上下文窗口为程序,LLM为解释器。他还提出理解AI能力分布的框架,给出创业建议。
UserBench 与 UserRL 带来的交互智能范式转向
当下大模型在与用户交互时存在不足,来自UIUC与Salesforce的UserBench和UserRL两篇新作,将‘用户价值’量化,把‘可测的交互’转化为‘可训练的策略’,从评测和训练层面推动模型向‘懂用户’转变。
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。
长程任务飙升98%,斯坦福Skill原生LLM来了
普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。
AI 原生软件工程的可观测性与可控制性
文章指出 AI 成研发主力军,改变软件生产方式,传统研发管理办法需升级。当前人和 AI 协作有诸多问题,介绍了研发三阶段,阐述可观测性与可控制性概念、关键指标,以及实现可控制性的要素,强调二者结合构建高效研发体系。
Harness is the New Dataset:模型智能提升的下一个关键方向
文章指出当基模能力成熟,决定 agent 上限的是围绕模型搭建的系统,即 harness engineering。介绍其组件、设计原则,探讨模型与 harness 关系,还列举创业机会项目,最后推测下一范式是 Coordination Engineering。
从 CIPS & CLM 迈进:中国大模型的智能跃迁
中国中文信息学会2025学术年会暨第二届中国大模型大会(CIPS & CLM 2025)于10月28日在北京召开,众多专家学者参会。大会聚焦大模型多方面内容,发布“大模型基金”,举办多场报告与论坛,展现中国AI领域进展。
具身智能稀缺的数据,可能藏在这个游戏手柄里?
游戏录屏平台Medal掌握的玩家操作记录成机器人模型训练核心数据。其创始人皮姆创办General Intuition获高额融资,该公司用游戏录像预训练动作模型,但也面临数据多元性、任务表现及合作模式等问题。