「长链推理」共找到 2765 篇相关文章
白嫖微软开源Web Agent,独立开发者的第二双手:自动刷网页、跑脚本、盯进度,全交给 Magentic-UI
Magentic-UI是微软开源的Web Agent界面,能控制浏览器、执行代码等,解决长流程、重复且让人不放心全交给AI的任务。它可视化操作,有可复用计划图库等亮点,使用体验好,适合特定开发者。
19K star 霸榜,下一代的浏览器自动化神器!
做爬虫或Web自动化测试常因网页结构变动需重写脚本。Github上超火的Skyvern项目是基于浏览器的自动化代理,不依赖XPath或CSS选择器,用视觉识别结合大模型推理完成任务,已获19k+ star。
开源知识库,从 0 到上线,UltraRAG 企业知识库全流程实战 ,也许这是RAG最好的框架之一~~~
UltraRAG是基于MCP架构的轻量级RAG开发框架,核心设计工程友好。其3.0版强调推理可视化,适用于科研复现、企业知识库问答等场景,还介绍了使用方式,能解决RAG落地痛点。
7篇顶会NeurIPS 2025最佳论文都说了什么?
NeurIPS 2025七篇获奖论文揭示大模型思维同质化、推理能力虚幻边界等隐忧,也在注意力机制、神经扩展定律等方面取得物理学层面突破,为AI建立更严谨科学地基。
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
R1时代,RAG-Retrieval技术总结与展望~
RAG - Retrieval提供全链路RAG检索模型微调、推理及蒸馏代码,支持多模型、多loss和训练方式。还发布模型技术报告,设计评估框架,未来探索RL在检索领域应用。
如何训练VLA?丰田研究院发布史上最大实验规模「保姆级」教程
丰田研究院和清华大学发布教程,用大量数据训练89个策略模型并验证。聚焦Co - training,研究五大模态、三种策略,对比不同架构,揭示有效和无效模态,还探讨CoT推理及多方面实验。
OpenAI最新硬件2026年底亮相!狂挖苹果20+老将,首款神秘设备或将颠覆iPhone
OpenAI硬件野心浮出水面,收购io后从苹果挖来二十余名工程师,预计2026年底推出首款消费级设备。它还利用苹果供应链,同时在算力上投入巨资解决瓶颈问题。
提速30倍,Meta重新定义了新一代RAG!
LLM时代,RAG成知识密集型任务标准范式,但处理长上下文时面临延迟高、内存贵问题。Meta超级智能Lab针对RAG特殊结构优化,提出REFRAG框架,有独特训练策略,实验效果显著。
中学生就能看懂:从零开始理解LLM内部原理【十二】|位置嵌入 - 给模型装上"GPS"
文章指出Transformer对词顺序不敏感,引出位置嵌入概念。介绍经典的函数编码、可学习位置嵌入法及新主流RoPE,还提及为让模型处理长文本,在RoPE基础上用PI和YaRN等扩窗技巧。