「深度推理能力」共找到 5129 篇相关文章
千问Qwen旗舰预览版Qwen3.6-Max-Preview发布
千问Qwen发布下一代旗舰模型早期预览版Qwen3.6 - Max - Preview,在权威评测中登顶最佳国产模型。此前开源的Qwen3.6 - 35B - A3B用30亿激活参数匹敌数百亿参数稠密模型,新模型在多方面给出技术演进方向。
上交大54页综述讲透Agent认知外部化的演进之路
上海交大联合多机构提交综述论文,首次以「外部化」为统一视角,梳理了LLM Agent的记忆、技能、协议与Harness工程四大支柱。指出Agent实际进展取决于外部认知基础设施,而非模型能力提升。
OpenAI发布新模型 GPT-Rosalind:专攻生物学、药物发现和转化医学
OpenAI发布生命科学前沿推理模型GPT - Rosalind,目标是生物学研究等领域。它是生命科学模型系列首款产品,在多方向表现强。当前以研究预览版向特定合作机构开放,有意机构可申请。
不再迷信Hackathon,把Agent推翻重做了4次!Notion负责人复盘:做AI产品如何避免“逆流而上”?
Notion负责人复盘Agent开发历程,指出AI替代的是流程。他们将模型、产品和权限接入同一框架,历经多次重构,还探讨了组织管理、评估体系、软件工厂等内容,分享对CLI和MCP的看法及产品定价策略。
The Batch: 940 |Claude Mythos Preview 引发安全担忧
Anthropic为即将推出的Claude Mythos Preview采取特别预备措施,因其会带来网络安全风险。该模型能力强大,能发现众多代码漏洞。Anthropic组建联盟增强防御,其表现也优于多个知名模型。
成本降70%!清华、阿里通义带来智能体长程任务新解法
AI智能体处理长程任务常遇上下文超载问题。清华与阿里通义研究人员提出MemPO算法,赋予大模型主动管理记忆能力,准确率提升,计算资源消耗降近七成,不过评价机制有局限。
杀死“流水线”: ColaOS(ListenHub)如何构建 AI 时代的液态超级团队 | QCon
4月16 - 18日,QCon全球软件开发大会将在北京举办,聚焦Agentic AI等前沿话题。ColaOS联合创始人徐文健将分享《杀死“流水线”》,复盘ListenHub“任务酒馆”模式,揭示让组织具“液态”创新能力的逻辑。
重磅!Anthropic又一个平台级产品炸场:Harness难题一次性解决,把Agent宠物变成牲口
Anthropic推出Claude Managed Agents,一套为云端大规模构建和部署智能体设计的API套件,已在Claude Platform上线公测。它全托管基础设施,专为Claude模型优化,多家企业已在生产环境使用,还同步发布工程博客解释架构设计思路。
AI Agents的DeepSeek顿悟时刻:AutoHarness
文章介绍开源项目「Aha」— AutoHarness,这是面向AI Agent的自动化Harness Engineering轻量级治理框架,能让智能体迎来顿悟时刻。对比了其与LangGraph、OpenAI SDK能力,还给出核心架构、安装及使用示例。
首个用户生活「长程模拟器」来了!LifeSim 重新定义大模型个性化评测
现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦大学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。