「模型架构创新」共找到 8869 篇相关文章
OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式
现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。
Qwen3又又又发布了新模型~~~
Qwen3团队继发布`Qwen3-235B-A22B-Instruct-2507`和`wen3-235B-A22B-Thinking-2507`后,又发布`Qwen3-Coder-30B-A3B-Instruct`。该简化模型性能和效率出色,有多项关键增强功能,且是非思考模型,输出效率高。
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
LangFlow: 挑战离散扩散,探索下一代语言模型新范式
UIUC Ge Liu团队发布《LangFlow: Continuous Flow Matching for Large Language Models》,回归连续扩散架构。研究指出连续扩散受挫非先天缺陷,经优化,LangFlow让连续扩散在标准基准追平离散扩散,为多模态统一架构打通底层路线。
一份最新具身智能中的世界模型&安全综述
本文分享2篇具身智能世界模型和安全挑战的综述。2025年10月的综述用三维坐标轴整合文献。还介绍世界模型分类、性能表现,围绕自动驾驶与机器人领域分析安全隐患并实证评估。
智普入局OCR! GLM-OCR 0.9B 也杀进来了~
OCR是上古任务,如今大模型纷纷入局,用1B以下小参数模型搅动解析市场。GLM-OCR能做文本识别等,采用三级架构,有两阶段流水线及训练机制创新,在多场景表现出色。
Anthropic新模型偷「吃瓜」!最强Fable 5爆冷
Anthropic提前曝光两个新模型claude-mashmallow-eap和claude-melon-eap,早期实测Marshmallow更佳。此前上线的最强Fable 5爆冷,企业调用少,营收低,其弟Opus 5反而胜出,开源模型也在抢占份额。
让AI学会潜意识推理,Sapient发布类脑模型HRM
新加坡初创公司Sapient Intelligence发布仅2700万参数的分层推理模型HRM,在多项高难度推理任务上超越大模型。它绕过大模型推理困境,借鉴大脑机制,训练效率高,开源后GitHub星标突破10.3k。
国产王炸!上海AI Lab开源Lumina-DiMOO,开创多模态理解与生成新范式
上海人工智能实验室等多机构推出多模态生成与理解统一模型Lumina - DiMOO,采用全离散扩散架构。它解决传统多模态架构问题,有全离散扩散建模等四大创新,性能在多基准测试中领先,应用前景广。
Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密
Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。