「上下文工程」共找到 1229 篇相关文章
NeurIPS 2025 | 中科大、港中深、通义千问联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%
大型推理模型在精确数学计算上存在问题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千问联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。
开源即登榜!登顶全球前十AI编程智能体,UCL初创团队开源Prometheus
UCL初创团队EuniAI开源AI软件智能体Prometheus,在SWE - bench Verified上Pass@1达71.2%,成绩入官方主榜。它有图结构推理设计,能理解代码,成本低,官网有Demo展示其工程化能力。
BesiegeField:LLM能否学会设计机器?
香港中文大学推出基于游戏《Besiege》的测试平台BesiegeField,探讨LLM能否学会设计机器。研究通过组合式机器设计视角,测试LLM,提出多智能体迭代设计流程等,发现LLM有挑战但并非不可实现,如Gemini 2.5 Pro表现不错。
AIAA J | 香港理工大学王旭等:目标导向的特征提取-以特征构建增强数据驱动模型
该论文通过对比学习理清潜在输入特征与目标输出的关联性,提出输出驱动的输入特征构造方法。所构造特征在高维代理模型构建中增强效果显著,还可减少预测误差分布及不同模型收敛性和鲁棒性差异。
Anthropic 深夜祭出 Claude Sonnet 4.5,能自主工作 30 小时!CEO:它更像你的同事
昨夜凌晨,Anthropic 推出新一代模型 Claude Sonnet 4.5,官方称其是世界上最好的编码模型等。该模型性能跑分登顶,工程落地能力强,还带来产品生态升级,开放 Agent SDK,误报率降低,价格亲民。
Meta最新REFRAG框架引爆RAG圈!KV缓存暴降90%,速度狂飙30×
Meta推出REFRAG框架解决RAG难题。它能在不修改解码器参数下压缩上下文、复用文档向量等。实验显示,它降低KV缓存、加速TTFT,在多任务表现佳,为大模型与知识库结合提供新范式。
RAG2.0进入“即插即用”时代!清华YAML+MCP让复杂RAG秒变“乐高”
检索增强生成系统(RAG)复杂度提升,开发者面临高昂工程成本。基于MCP架构的UltraRAG 2.0框架,让科研人员用YAML文件声明复杂逻辑,降低技术门槛与学习成本,还提升了复杂多跳问题性能。
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
反常识!GPT-5和Opus 4同时翻车:AI越强,越不爱用工具?
作者用GPT - 5和Claude Opus 4做进化实验,让其开发工具。两模型表现出色,但面对实际任务却不用自制工具。原因包括模型规模使脚手架工作无价值、RLHF带来工具厌恶、逼近AGI渐近线等。
谷歌又来砸饭碗!免费AI Agent发布,程序员狂喜
谷歌发布免费开源的AI Agent——Gemini CLI,可在电脑终端运行。免费额度高,用个人谷歌账号登录就能用Gemini 2.5 Pro,还有大上下文窗口和高请求额度。它能力不止编码,功能强大且易上手。