「长上下文任务」共找到 2874 篇相关文章
号称1200万token上下文的模型来了,数据亮眼但疑点重重
当地时间5月5日,Subquadratic公司推出模型SubQ,称是LLM智能重大突破,有1200万token上下文。数据亮眼,如在1M token场景比FlashAttention快52倍等,但也引发质疑,有人推测是对开源模型微调,官方未公布详细模型卡。
跨机器、物体与各种任务!RoboScience发布通用具身大模型
RoboScience机器科学发布Visics通用具身大模型并披露VLOA技术架构。该模型从底层搭建全新具身基础表征单元,适配任意机器人、物体和任务。其由具身世界模型和通用操作模型组成,有强大泛化和操作能力。
DeepAgent:能够自主找工具的深度思考智能体,工具&任务随心配
现有智能体框架自主性差、工具使用受限。中国人民大学等机构研究者提出DeepAgent,能自主思考、发现工具并执行动作。它在多基准测试中表现出色,为构建更强真实世界智能体迈进重要一步。
从上下文工程到 AI Memory,本质上都是在「拟合」人类的认知方式
文章结合胡塞尔现象学,探讨从上下文工程到AI Memory,指出它们本质在‘拟合’人类认知。介绍二者概念及构建方法,对比人类与AI记忆异同,还通过与胡塞尔对话,思考AI意识等哲学问题。
Google | 溯源分析RAG系统错误,提出选择性生成框架,让RAG问答准确率提升10%
Google对RAG系统错误深入分析,引入‘充分上下文’概念,指出幻觉或因上下文不足。构建评估器,提出选择性生成框架,结合多信号决策,实验显示可让RAG问答准确率最高提升10%。
现在模型这么强还需要专业提示词吗?
文章探讨是否还需专业提示词,指出简单任务无需复杂提示词,但复杂任务时,它能像‘数学公式’拆解需求,还能充当‘工作流经理’。用好提示词能让AI成生产力工具。
Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜
Einsia AI旗下Navers lab发布Agent Benchmark——Frontier-Eng Bench,让AI在47个多学科交叉的硬核任务中做工程优化,测试其迭代优化能力。研究总结出AI进化规律,初步勾勒接近真实工程循环的AI系统。
低Token高精度!字节复旦推出自适应推理框架CAR
字节与复旦大学研究人员提出自适应推理框架CAR,能根据模型困惑度动态选短答或长推,在多基准测试中平衡了准确性与效率,打破长文本推理必然性能更好的认知。
从《塞尔达传说》理解 Agent 的上下文工程:Claude Skills 还是被低估了
Claude Skills 是为 AI 设计的「技能包」,能把复杂任务指令打包。作者认为其信息分层设计哲学是关键突破,以《塞尔达传说》为例,介绍了信息分层和按需加载理念,还阐述了三层架构及应用案例、挑战和通用原则。
倒反天罡:「租个人」网站爆火,AI开始雇人「跑腿」了
「rentahuman.ai」网站定位为「AI 的肉身层」,AI 可通过 MCP 协议或 REST API 雇人完成线下任务。网站上线后人力增长快,但也引发付款、任务真实性、安全伦理等疑问。