「推理场景」共找到 3728 篇相关文章
美团智能体SOTA模型LongCat-Flash-Thinking-2601开源
美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。
什么时候不该微调:比“怎么微调”更重要的一件事
文章指出微调失败常因一开始就不该调。强调微调解决行为问题而非能力问题,还列举了不该微调的五种场景,如知识接入问题、Prompt没写好等,建议先验证思路,明确目标再行动。
mcpx?要来拯救mcp!让工具调用不再吃掉你的上下文
MCP传统集成方式需在对话前加载所有工具定义,易使上下文溢出。开发者cs50victor基于mcp - cli构建mcpx,按需发现工具,大幅节省token,提升准确率,适合本地部署,虽有额外推理调用,但利大于弊。
100万亿Token揭示今年AI趋势!硅谷的这份报告火了
OpenRouter和a16z联合发布《State of AI:An Empirical 100 Trillion Token Study with OpenRouter》,基于100万亿Token分析模型真实使用情况,揭示2025年AI发展趋势,如开源模型崛起、推理模型成新范式等。
超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力
文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。
MCP 或将成弃子
Anthropic工程师发博客‘背刺’自家MCP,提出新方案让token消耗大减。新方案把MCP服务器转成代码文件运行,Skills或成MCP替代品,虽MCP还有价值场景,但多数情况下代码+Skills更优。
兄弟们,起飞啦,揭秘Claudable给你写代码的魔力 Github 3k star !!!
Claudable是Opactor AI组织开放的开源项目,它结合Claude Code强大的AI代理能力,能把自然语言描述的产品概念自动翻译成可部署的Web应用,解决传统Web开发痛点,功能强大且应用场景广泛。
LeCun团队开源首个代码世界模型:能生成代码还能自测自修!传统编程模型一夜成古典
Meta FAIR推出全球首个代码世界模型CWM,它能生成代码、理解语义,还‘懂得’代码执行,能模拟运行过程。在多个代码与推理任务表现出色,开源代码、训练细节等,不过目前仅支持Python。
拆箱开源版Coze:Agent核心三件套大公开,48小时揽下9K Star
扣子两款子产品扣子开发平台和扣子罗盘近期开源,加上此前开源的开发框架Eino,覆盖了Agent开发全链路。其采用宽松的Apache 2.0开源协议,降低开发门槛,有望带动Agent在更多场景落地。
从性能到实战,怎样才算是靠谱的 Agent 产品?
红杉中国团队提出AI基准测试工具Xbench,其双轨测评体系不再单纯执着于测评问题难度,重点量化AI系统在真实场景的效用价值,还构建长青评估机制,以确保评估结果的时效性和相关性。