「推理能力」共找到 4625 篇相关文章
首个语音智能体端到端测评出炉:Grok登顶,真实场景通过率仅一半
Artificial Analysis推出业内首个语音转语音智能体端到端性能基准τ - Voice,测试真实客服场景能力。结果显示最强S2S模型成功率刚过一半,Grok Voice Think Fast 1.0夺冠,但也面临诸多质疑。
原来Ilya还有70亿美元OpenAI股权
马斯克与奥特曼世纪庭审炸出OpenAI造富神话。Ilya手握70亿美元股权,Brockman持股近300亿美元,奥特曼股权也在赶来。普通员工也获利丰厚,75人套现两亿,超600人成百万富翁。
监管叫停外资收购Manus背后,有一个被忽视的关键问题|甲子光年
4月27日,国家发改委叫停外资收购Manus项目。该项目从2025年12月Meta宣布收购起备受关注。此次监管选择外商投资安全审查路径,预示AI时代监管侧重技术控制权,也可能加速VIE架构消亡。
从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
90 后华裔女高管 Cat Wu 推动 Anthropic 产品按天迭代。她介绍团队分工、产品决策围绕安全 AGI 使命,还谈及源码泄露、模型使用等问题,分享工具使用场景及对 PM 能力要求,鼓励用 AI 自动化工作。
在AK大神爆火的任务里,摸清国产AI真实水平
4月20日深夜Kimi K2.6发布并开源,作者借Andrej Karpathy的AI Wiki思路设计高承压任务,测试其Agent底层能力,考察它在单Agent、Agent网站和Agent Swarm三种模式下表现,探究国产AI真实水平。
实战案例|当本体遇上 Agent:让 AI 真正“听懂业务”并“按规矩办事”【上】
本文是“企业级本体应用”系列第三篇,探讨本体如何融入企业智能体系统。指出本体非数据库或图谱,是语义层。介绍本体在Agent系统的架构与职责,通过案例展示用本体做规则判断和多维归类,凸显其优势。
刚刚,Meta 发布新模型,股价大涨 10%
Meta发布新模型Muse Spark,是原生多模态推理模型,支持多种功能。其沉思模式处理复杂问题表现佳,还有新购物模式。虽评论区有质疑,但Meta股价大涨。模型未开放API等,实际实力待察。
MASFactory: 多智能体系统开发进入Vibe Graphing时代
AI能力迭代,多智能体编排却停留在旧阶段。北京邮电大学GAMMA Lab团队发布MASFactory,用Vibe Graphing编排多智能体系统,融合多种开发方式,有全栈可视化等优势,还给出实用案例和开源代码。
FlowUs 创始人创立 Kollab,要为 AI 构建团队大脑
AI 从对话框向 Agent 等形态演变,完成单个任务能力增强,但工作场景中仍有协作断裂问题。Kollab 产品想解决此问题,让任务在组织自动流动,切中 Team - level AI,有共享工作空间等 4 个层级。
Karpathy 亲手终结了RAG的草莽时代
Andrej Karpathy分享“LLM Wiki”工作流,将多数Token用于构建“可演化知识库”。此方法不依赖复杂架构,在中等规模数据集上展现出强大能力,引发“LLM Wiki杀死RAG”的讨论,在技术社区和企业级市场反响热烈。