「推理技术栈」共找到 4733 篇相关文章
大模型竞赛转向:决胜关键为何是“后训练”?|甲子光年
大模型价值主战场向后训练转移,Grok 4凭后训练成“宇宙最强”。产业应用中通用模型适配难,后训练方法也在进化,如采用SFT+RL等,还介绍了夸克和阿里云的后训练实践。
如何将LLM的"思考习惯"迁移到视觉领域?
传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。
3.2K star!!高中生开发,媲美IDM,这款开源下载神器厉害了!
最近发现一款开源项目Ghost - Downloader - 3,由高中生独立开发,支持三平台,用Python编写且运行快,还融入AI技术自动调教下载策略。已有3.2K star,功能强大,安装和使用都简单。
揭示隐藏联系:RLHF/DPO即对比学习!
大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。
看懂毫米波雷达,这一篇就够啦!
文章介绍毫米波雷达,它是频率30GHz - 300GHz的电磁波,兼具微波与远红外波特点,有高数据传输速率、高分辨率等优势,也有绕射能力差等弱点,在多领域应用前景广,移远通信等企业正布局。
太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%
在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。
Meta发布40页报告,具身智能的下一步是「心智世界模型」:能听,能看,能理解,会共情
Meta发布40页报告,首次将对人心智状态的推断概念化为心智世界模型,与物理世界模型实现“双轨建模”。还指出要结合系统A和B让AI自主学习,心智世界模型在多智能体协作潜力大。
“英伟达显卡就是一坨*”!博主6000字檄文怒批:烧接口、缺单元、驱动变砖还威胁媒体
博主Sebin发布近6000字檄文批判英伟达,指出其显卡有烧接口、缺单元、驱动变砖等质量问题,销售策略存在库存少、黄牛多、捆绑销售等问题,还试图操控媒体及评测机构。文章在Hacker News引发大量讨论。
120页深度报告,搞懂今年大模型和应用的现状与未来
Innovation Endeavors合伙人Davis Treybig发布《State of Foundation Models》(2025),从七个维度剖析AI产业现状与趋势。报告指出,AI发展迅速,模型成本高且迭代快,应用渗透各行业,智能体崛起,市场结构变革,公司运作方式也在重塑。
Gemini负责人爆料!多模态统一token表示,视觉至关重要
Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。