「检索任务」共找到 2156 篇相关文章
用AI写代码效率反降19%!246项任务实测,16位资深程序员参与
研究者让16位经验丰富开发人员完成246项开源代码任务,随机分配是否用AI。结果显示,用AI时完成任务平均时间增加19%,与开发者预测的效率提升24%相反。
1.4K Star!不要问答,要完成任务,一个合格的金融Agent应该是什么样?
过去一年AI Agent火热,但金融场景投研是长链路任务,有诸多硬约束。LangAlpha是Ginlix AI推出的开源金融Agent项目,能解决实际金融研究任务,有核心架构和关键能力,还给出使用方式、典型Demo及横向评测。
跨越技术与法律的壁垒:AI赋能知识产权领域任务全能评测基准IPBench发布
本推文介绍arXiv论文《IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property》。论文提出IPBench评估基准,构建含20个任务、10374个双语数据点的基准,评估17个主流模型,揭示现有模型在IP任务中局限。
打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner
人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。
手机AGI助手还有多远?移动智能体复合长程任务测试基准与调度系统发布
上海交大与澜舟科技研究发现现有移动端GUI智能体处理复合长程任务能力不足,提出UI - Nexus测试基准和Agent - NEXUS调度系统,经实验能提升任务完成率,也为AI原生操作系统建立雏形。
EMNLP 2025 | CARE:无需外部工具,让大模型原生检索增强推理实现上下文高保真
MetaGPT等机构团队发布CARE框架,可让LLM将推理上下文与自身检索能力结合,已全面开源。它提出原生检索增强推理范式,采用两阶段训练策略,在问答基准实验中表现出色,为解决模型问题提供新路径。
全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品
蚂蚁通用人工智能中心自然语言组联合香港大学自然语言组推出PromptCoT 2.0,押注任务合成。它让30B - A3B模型在数学代码推理任务达SOTA,全面升级效果、数据和方法,还将考虑多方向发展。
让大模型多模态检索全面超越SOTA!ReCALL框架化解生成式与判别式的范式冲突|CVPR'26
紫东太初团队联合新加坡国立大学攻克大模型检索难题,其ReCALL框架以‘诊断 - 生成 - 校准’闭环体系解决范式冲突,让大模型变身高效检索器,成果被CVPR 2026录用,刷新SOTA性能。
捅破具身智能天花板!极佳视界新VLA大模型登场,复杂长时程任务近100%成功率
极佳视界推出GigaBrain-0.5M*VLA大模型,以世界模型条件驱动,引入人在回路持续学习机制。在与主流方法对比中,任务成功率提升30%,长时程任务近100%成功,还具备高效准确的价值预测能力。
人类或将沦为“NPC”!智谱创始人唐杰最新研判:LLM正从攻克长程任务到全自主进化
智谱创始人唐杰认为今年LLM技术突破点在长程任务,能在智能体环境交互完成复杂任务。随能力提升,将迈向‘无人公司’时代,人类或成‘NPC’。后续要攻克记忆、学习等技术,实现自我进化,重塑产业。