「ToM推理框架」共找到 3362 篇相关文章
你敢信?GPT-5的电脑操作水平只比人类低2%了
Agent S3刷新了计算机使用智能体(CUA)在「OSWorld」基准测试的记录,性能达69.9%,接近人类水平。它引入bBoN实现并行扩展,还精简框架、引入原生代码智能体,已开源并发布论文。
GPT-5「降智」真相曝光:不是变笨,而是五个超级开关没激活
新智元报道,OpenAI最新提示工程指南揭秘调教GPT - 5的方法。通过调整自主探索倾向、推理深度等五个开关,可让GPT - 5从偶尔靠谱变全能,还介绍了元提示小技巧解锁其潜力。
挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因
随着大语言模型发展,多智能体系统潜力大但失败率高。新加坡国立大学等机构研究者提出AgenTracer框架,构建标注管线、设计轻量级追踪器,在失败归因任务上超大型闭源模型,还能助力系统自我提升。
九天大模型大变身:性能狂飙35%!还能一键P大象
7月26日,中国移动在2025世界人工智能大会发布「九天」基础大模型3.0,端到端技术全面升级,复杂推理能力提升35%,智能体调用效率提升21%,还推出代码、数学等专项大模型,多模态能力也焕新。
Agentic AI 要终结数据库和 SaaS?大厂掌门人公开互撕,焦虑的 CEO 们押上了不同的技术路线
2025年Agent成AI热词,科技巨头与初创公司纷纷布局。微软和Salesforce掌门人公开“互呛”,代表两种不同落地路径。前者主张通用框架,后者强调垂直集成。当前二者Agent均有落地,但面临技术、成本等挑战。
GraphRAG还在持续进化,FlowRAG让证据链自己流起来
上海AI Lab和华东师大论文提出FlowRAG,它是GraphRAG变体,把RAG检索从按相似度排文本块推向沿证据流找推理路径。在多数据集上表现不错,虽平均Relevance低于LinearRAG,但更能保证证据链完整。
DeepSeek不惜代价保住它!V4关键特性被挖出来了
DeepSeek V4技术报告被深挖,为保留核心设计「batch invariance」不惜代价。该设计能保证线上推理稳定、各环节对齐,是复杂上下文系统底座,但会牺牲GPU利用率等,换来训练等多阶段可复现和稳定度。
100万亿Token看懵硅谷!全球一半算力写代码,另一半在「搞颜色」 ?
OpenRouter和a16z联合发布报告,基于100万亿Token实证数据揭秘2025年AI发展。开源模型流量占比达30%,推理模型成主流,编程和角色扮演是主要使用场景,亚洲付费使用量翻倍,中文成全球第二大交互语言。
TileLang vs Triton 详解:谁该握住控制面——编译器还是开发者?
文章对比 TileLang 与 Triton 两个框架,解释控制面设计、并发协议、编译管线的本质差异,以及这些差异如何影响性能上限、工程投入。明确 TileLang 追求榨干内核,性能上限高但对开发者要求高;Triton 追求快速落地,生态成熟。
吴恩达关注的Ling-1T背后,蚂蚁Ling 2.0技术报告解密万亿模型开源配方
AI导师吴恩达关注蚂蚁开源模型Ling-1T,其性能直逼闭源模型。蚂蚁集团通过《Ling 2.0 Technical Report》揭示技术配方,从架构、预训练、后训练对齐和基础设施四个层面构建推理模型,还分享失败教训,提供开源SOP。