推理智能体」共找到 5523 篇相关文章

算法论文8

10步优化超越强化学习,仅需1条未标注数据!后训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就显著提升大模型在理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。

新智元
算法论文8

RAG新SOTA,还在5亿条数据上跑进秒级,只有它了

本文围绕RAG技术展开,指出传统RAG在多跳理等方面存在局限。介绍了GraphRAG、HippoRAG 2的优缺点,重点阐述Zleap AI的SAG方案,它用超边结构重构数据底座,在多跳问答测试中表现出色,还在大规模数据下低延迟落地。

机器之心
产品应用8

AI Code要变天了,Meta首个代码世界模型登场!

Meta FAIR出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和理,code和mode已开源。在SWE - bench验证中表现优,与更大规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。

PaperAgent
算法论文8

机械手真正「活」了,银河通用&清华出DexNDM,用神经动力学重塑灵巧操作

银河通用与清华出DexNDM,旨在解决灵巧操作技sim - to - real难题。它让灵巧手掌握多种转轴、多样手腕朝向下旋转物体的技,构建的半自主遥操系统可完成复杂工具操作和长程装配任务,在sim - to - real方法上有创新。

机器之心
算法论文7

超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭

近日MIT研究者发现测试时训练在大模型应对复杂理问题时,分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性显著提升,超Claude 3.5等。但该策略部署效率低。

新智元
推荐文章8

Thinking Machines又发高质量博客:力LoRA,不输全量微调

Thinking Machines 博客力 LoRA 并与全量微调对比。研究发现小数据量任务中 LoRA 与全量微调效果接近,大数据量稍吃力,强化学习中低秩 LoRA 也接近全量微调。还揭示了 LoRA 关键要素、超参数规律等。

机器之心
开源动态8

「具身原生」元年!专访原力灵机汪天才,解析具身智的「PyTorch时刻」

2月10日原力灵机发布开源具身原生框架Dexbotic 2.0,宣布与RLinf合作。合伙人汪天才将其与RLinf结合定义为具身智的「PyTorch时刻」。还出具身大模型DM0和应用量产工作流DFOL,动具身智进入「具身原生」时代。

机器之心
新闻资讯7

英伟达挑战者,估值490亿

AI芯片初创公司Groq完成7.5亿美元融资,估值达69亿美元。它由前谷歌工程师创立,致力于打破英伟达垄断,产品低成本维持AI性,但在生态、大规模模型支持等方面与英伟达有差距,短期内难威胁其地位。

芯师爷
推荐文章7

a16z:AI 产品初期用户流失高很正常,M3 留存才是评估 PMF 的关键

a16z研究团队分析数百家AI企业后发现,将衡量用户留存率基准点从M0后移至M3,更清晰评估PMF和GTM策略。AI产品留存曲线分获客、留存、扩张三阶段,M12/M3比率是预测长期留存关键指标。

Founder Park
新闻资讯8

谷歌AI掌门人、诺奖得主Demis:AGI 需要打破“金鱼记忆”,而谷歌无论泡沫破裂与否都将是赢家

谷歌AI掌门人Demis接受专访,回应AI是否有“金鱼记忆”、AGI定义等尖锐问题。他认为通往AGI需突破,大模型是核心组件;真正AGI要执行人类所有认知任务,离实现还有5 - 10年;还看好智眼镜,强调保护用户对AI信任。

AI科技大本营