「FP4训练」共找到 3409 篇相关文章
Monet:赋予多模态大模型如人类一般的抽象视觉思考能力
文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。
阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning
阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。
多模态RAG哪家强?9 个 Embedding、4 类 MLLMs、4 大框架实景比拼
现有文档 RAG 评测存在不足,华南理工和华科推出 DOUBLE - BENCH 进行多模态 RAG 实战评测,结果显示检索是瓶颈,模型爱胡说。快手开源 Keye - VL - 1.5 - 8B,PaperAgent 有实操指南。
Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制
论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。
Claude Code 新功能 Agent Teams:4 类活效率翻倍,4 类活纯烧 token
Claude Code v2.1.32 后新增实验性功能 Agent Teams,可将其从单个 AI 助手升级为 AI 团队,但会使 token 用量线性放大。文章总结了适合和不适合用此功能的任务类型,还给出决策清单、实战避坑建议。
V4Flash 的价格、Opus4.8的能力,Ox Alpha (牛来)正式开源!
Ox Alpha 匿名模型上线 OpenRouter 后表现亮眼,消耗大量 tokens 并终结 DeepSeek 霸榜纪录。官方揭晓其为智谱 GLM - 5.3 Flash,价格低、能力强,经多场景测试,多模态理解等维度达顶尖水平。
GPT-5真的拉胯吗?机器之心一手实测,网友:还我4o、还我4.5
OpenAI发布GPT - 5后评价褒贬不一。有人认为它进步大,也有人差评,如制作游戏、重构代码失败。机器之心实测发现其表现不稳定,写作、推理、编码能力有好有坏,复杂任务表现欠佳。
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练
美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。
4.4k星!给Agent接上「本地免费搜索爬虫」,内置11个skill执行数据搜索、爬取、自动研究
文章推荐开源本地搜索工具wigolo,它是专门给Agent使用的本地网络能力层,可解决本地运行Agent查找资料时使用API麻烦费钱的问题。它功能多样,有搜索、缓存等工具,自带11个Skill。
4.2w颗星!学术科研 AI 工作流
这是一套有4.2w颗星的学术研究技能包,涵盖研究到论文出版全流程。它不替写论文,接手搜文献等杂事。有四个核心skill,支持多文献引用格式,能编译成PDF,还介绍了安装和使用方式。