「混合训练框架」共找到 3555 篇相关文章
NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临
传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。
最好的 DeepResearch 平替开源了
ROMA是元代理框架,以递归分层结构解决复杂问题,有并行问题解决、透明开发等优势。它通过计划 - 执行循环处理任务,介绍了安装选项、技术栈,还有预构建代理展示功能。
DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。
DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。
面壁MiniCPM4推理速度3倍,碾压同尺寸Qwen3,阿里上眼药了~
面壁发布包含10个模型的MiniCPM4系列,其推理速度快。它有高效模型架构、学习算法、高质量训练数据和推理系统等创新点,还给出了MiniCPM4实战代码及启用InfLLM v2的参数设置。
Google研究发现:Multi-Agent的核心竟然是Prompt设计!
Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。
DoorDash 如何打造了一款不完全依赖大型语言模型(LLM)的 AI 购物助手
DoorDash 分享对话式 AI 助手 Ask DoorDash 的架构,它借助 LLM、AI 代理等构建系统。测试显示其提升了结账转化率等指标,还构建自动评估框架改进质量衡量,架构分离协调与业务功能。
全员本科生!何恺明组新作:文生图,258M参数就够了
何恺明携本科生团队推出文生图模型MiniT2I,基于MM - JiT架构,仅用258M参数实现不错效果,训练成本低。该架构删繁就简,去掉VAE和AdaLN等模块,性能提升,展现出与工业级模型的竞争力。
从「片段生成」到「长视频漫游」:OmniRoam探索轨迹可控的长视频生成新范式
在生成式视频发展中,长时序视频生成面临挑战。研究者提出 OmniRoam 新方法,通过全景表示和分阶段生成框架,提升视频时空一致性,还构建数据评测体系,实验表现优,有效率和 3D 应用潜力。
统一VLA范式!港科大开源StarVLA乐高式架构,复现成本大幅降低
当前具身智能的VLA赛道陷入「碎片化」泥潭,方法难对比、复现成本高。港科大开源StarVLA,提出「乐高式」统一架构,构建模块化开源底座,实现双向模块化,还支持多种训练范式,打通Sim2Real。
库里被「采访」、杨紫被「演」短剧?别慌!蚂蚁AI鉴真拿下CVPR 2026冠军,专治黑产
深度伪造技术滥用,明星成换脸受害者,引发社会关注。蚂蚁集团AI安全实验室队伍MICV获CVPR 2026挑战赛冠军,还发布检测资源仓库。团队提出基于DINOv3的框架,解决AIGC检测难题,成果显著。