「多Agent并行推理」共找到 4663 篇相关文章
刚刚,OpenAI前CTO Mira Murati公司Thinking Machines Lab发文,揭开了大模型不确定性的真相
OpenAI前CTO Mira Murati创立的Thinking Machines Lab推出研究博客Connectionism,首篇文章聚焦LLM推理的非确定性问题。研究发现真正原因是批次不变性缺失,提出实现批次不变内核的方案,实验效果显著。
ClockBench:一个简单的钟表测试让AI全线溃败
ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。
GPT-5通关《宝可梦水晶》创纪录!9517步击败赤爷,效率碾压o3三倍!
GPT-5通关《宝可梦水晶》创纪录,仅9517步击败赤爷,步数为o3的三分之一。它在主线任务效率也远超o3,如收集徽章、对战四天王等。其优势在于幻觉少、空间推理和目标规划能力强。
一年上线超 10 款产品,AI 时代如何做独立开发
ThinkAny&MCP.so 创始人艾逗笔分享独立开发感悟与经验。他一年半做了十来款 AI 产品,认为开发要快,也需长期主义。还给出 AI 应用出海经验,介绍可 all - in 的 AI 创业方向,如 AI Coding、Agent 等。
钉钉为 AI 找了个绝佳工位
随着AI浪潮袭来,企业让AI Agent落地提效遇难题。钉钉以数据表格为架构实现AI应用化,将单元格变为AI“工位”,汇集AI工具、沉淀业务系统,还融合表格与文档、支持提醒功能,解决企业痛点。
给龙虾定MBTI、发工牌,还让龙虾偷技能…打工人得适应新环境了
AI圈掀起“养龙虾”热潮,智谱、腾讯纷纷发布相关产品。极客和开发者对龙虾进行实测,它不仅能用于打造赛博宠物、线上办公室,还能完成视频剪辑、教辅、营销等工作。同时,Agent框架让大模型进入业务线,飞书成合适的工作台。
LlamaIndex 深度实战:用《长安的荔枝》学会构建智能问答系统
文章兼顾 RAG 科普与 LlamaIndex 实战。介绍 RAG 原理,用《长安的荔枝》讲解关键步骤和参数。实战部分展示用 LlamaIndex 搭建问答系统,代码量少。优化篇通过实验给出参数调优建议,架构篇剖析内部机制,最后提及 Agent 化拓展功能。
OpenAI夺金IOI,但输给3位中国高中生
OpenAI官宣其推理模型在今年IOI线上竞赛中成绩刷新纪录,总分533.29,全球330名人类选手中排第六,AI参赛者中居首。不过其没比过三位中国高中生。此前OpenAI称模型获IMO金牌引争议,此次网友更谨慎。
流式意图检测+永久记忆,NUS&NTU发布Pask:把贾维斯AI拉进现实
南洋理工大学谢之非团队提出Pask,采用「底层小模型流式意图检测」+「上层Agents执行」架构,实现实时、有深度、基于个人全局记忆自进化的主动智能体。它包含需求检测、长期记忆和主动系统模块,经测试效果良好。
腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?
最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高信号’起点,经实验验证低熵模型优势明显。