「长上下文任务」共找到 2874 篇相关文章
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
带图推理碾压同类开源模型!港中文微软等开源OpenThinkIMG框架,教AI学会使用视觉工具
港中文、微软等联合推出OpenThinkIMG开源框架,解决AI使用视觉工具面临的集成难、缺数据、适应差等问题,还公开核心技术V - ToolRL。该框架在图表推理任务上表现超GPT - 4.1,为下一代AI智能体提供基础。
ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理
现有视频虚拟试衣方法受限于固定相机视角,难以满足用户自由观察需求。本文提出 TryOnCrafter 框架,定义可控相机视频虚拟试衣任务,引入可渲染 4D 试衣代理,支持多种下游应用,为虚拟试衣开辟新路径。
315曝光的“AI投毒”原理:GEO这样操控大模型推荐
央视3·15晚会揭开AI“投毒”灰色产业链,利用GEO操控大模型推荐。介绍了训练数据污染、检索上下文劫持、提示注入诱导攻击三种“投毒”技术,还阐述了内容生产、渠道投放、效果强化的产业链运转流程。
蚂蚁具身研究首次亮相!就解决了机器人「看」透明玻璃这些难题,还开源了
蚂蚁灵波科技开源高精度空间感知模型 LingBot-Depth,针对性解决机器人识别真实世界的「玻璃问题」。其构建双线并行数据集,提出掩码深度建模思路,在深度补全等任务中表现出色,且已具备落地能力。
别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程
作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。
Claude Code is All You Need
Anthropic内部把Claude Code当万能助手。它核心理念是“一切皆文件”,能管理文件、日志和待办事项,还可打通Apple生态。MCP让其获取更多上下文。社区用户分享了在多场景的使用体验和技巧。
OpenAI 全面拥抱 Agentic-First,实测有点扎心
OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。
详尽地带你从零开始设计实现一个AI Agent框架
文章详尽介绍AI Agent框架,从理论到实践,涵盖多种模式、主流框架对比,强调上下文工程是核心,还给出极简框架实现及应用示例,虽有不足但能助看清Agent本质。
硬核拆解 OpenClaw:如何构建真正稳健的生产级 Agent 系统?【上】
本文深入剖析 OpenClaw 的 Agent 任务引擎,介绍其‘工作室’、整体架构、调度与并发控制、高可用与容错机制等。指出其架构有工程智慧,对构建生产级 Agent 系统有参考价值,下篇将介绍更多实践。