「自监督预训练」共找到 3068 篇相关文章
腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态大模型
多模态大语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。
X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA
中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
Anthropic最新论文:检测LLM内省意识的方法
Anthropic与MIT等研究表明,LLM能‘感知’被注入的steering vector,‘内省意识’在DPO等后训练阶段涌现。研究构建实验,发现内省能力行为稳健、检测非简单线性关联等,还揭示检测与识别机制不同及两阶段电路。
专访火思动力Kevin Ding:未来选择Agent,要看它过去三十天学会了什么|甲子光年
本文是对火思动力创始人Kevin Ding的专访。他指出当下Agent会工作但不会成长,而如今市场需求、技术条件和数据供给成熟,可开展持续学习。他还阐述了后训练、产品应用、商业化等方面观点。
李飞飞LeCun疯狂加注!这匹中国黑马,已在因果AI暗战6年
世界模型成AI核心战场,背后是行业向因果科学转向。多数人2026年关注“因果”,中国零犀科技早在2020年就探索因果AI,自研因果大模型,搭建工程架构,将能力融入业务体系,提前布局优势凸显。
RAG外部检索是多余的,英伟达最新成果颠覆认知
英伟达INTRA论文指出RAG架构中检索器和生成器在不同表示空间工作,存在retriever - generator mismatch问题。INTRA让模型用注意力查询检索自身编码表示,训练量小,在多跳QA上超越多种检索基线。
架构师困境:选择已被验证的道路,还是自行开辟一条新路?
开发软件时,团队要做产品功能和架构决策,面临选已验证路径还是自辟新路的困境。使用平台和框架虽能加快开发,但有副作用。团队需通过实验判断何时扩展或替换平台。
利用Loop语言模型扩展隐式推理 | 直播预约
当前大语言模型依赖显式文本生成推理,未充分利用预训练数据。将介绍最新工作Ouro,Loop语言模型家族,核心创新多,虽参数少却性能优,还会讨论其推理轨迹及模型Scaling新可能。
Gemini 3 Pro加持!这款开源神器 Clipsketch AI,帮你自动抓帧、画图、写爆文!
自媒体内卷,‘视频转图文’是流量入口,简单截图难满足需求。clipsketch - ai 开源项目用 Gemini 3 Pro 和 Nano Banana Pro 模型,实现视频理解、AI 绘画和写作自动化,解决创作者素材整理、版权等痛点。