「科学推理」共找到 2297 篇相关文章
陶哲轩看傻:三破18年数学纪录!谷歌推出「AI爱迪生」,科研不再靠灵感?
5月中旬谷歌发布AlphaEvolve,30天攻克18年未解难题。它利用Gemini模型发现新算法,从AlphaGo获启发,能在编程空间搜索方案,或开启不靠‘灵感’的科学革命,还将改变科学家角色。
R1时代,RAG-Retrieval技术总结与展望~
RAG - Retrieval提供全链路RAG检索模型微调、推理及蒸馏代码,支持多模型、多loss和训练方式。还发布模型技术报告,设计评估框架,未来探索RL在检索领域应用。
Transformer祖传设计遭暴击,COLM顶会三篇论文发难
COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。
如何训练VLA?丰田研究院发布史上最大实验规模「保姆级」教程
丰田研究院和清华大学发布教程,用大量数据训练89个策略模型并验证。聚焦Co - training,研究五大模态、三种策略,对比不同架构,揭示有效和无效模态,还探讨CoT推理及多方面实验。
美团开源Agentic新王,速度拉满,工具调用打爆Kimi?
周末美团开源LongCat - Flash大模型,参数量560B,推理速度达100 token/s,成本低,在Agent工具调用表现超Kimi - K2。它有Zero - Computation Experts和ScMoE创新,不过市场表现未获太多认可。
特朗普正收购英特尔10%股份,约100亿美元
凌晨华尔街日报消息,特朗普政府正与英特尔谈判,拟将“芯片与科学法案”部分或全部资助转成公司股权获10%股份,约100亿美元,旨在助其重振代工业务,目前谈判初期,股价有波动。
腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合
腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。
微软Build 2025大会Day 1:All in「智能体网络」,全面推动MCP
北京时间昨夜今晨,微软Build 2025开发者大会Day 1开场,CEO萨提亚·纳德拉透露“智能体网络”概念。大会展示微软在开发者工具、办公中枢、云平台等多方面进展,还宣布Microsoft Discovery平台加速科学突破。
Karpathy刚进Anthropic,转头又投了它
AI初创公司Engram成立8个月,估值达6亿美金,获9800万美元融资。它聚焦AI记忆,用Cartridges技术降内存、提速度,将推理和记忆层拆开,团队成员背景强大,押注AI范式新转向。
14.7M参数,小目标AP达到13.9%!FSDETR用频空融合重新定义目标检测
传统小目标检测问题多,2026年4月FSDETR论文提出频空融合法,用14.7M参数获13.9% APS成绩。它有SHAB、DA - AIFI、FSFPN三个核心模块,还给出训练、推理及导出ONNX部署代码。