「大模型架构」共找到 9891 篇相关文章
Qwen3深夜开源新系列:文本表征模型,3种尺寸可选,超越商业API拿下SOTA
Qwen3深夜上新Embedding系列,专为文本表征等任务设计,在Qwen3基础模型上训练,有0.6B/4B/8B三种尺寸,8B版本在MTEB榜单排第一,性能超商业API,已在多平台开源。
高效Agents的尽头是,Harness
文章指出玩Agent久了会出现问题,很多人简单将其视为“模型+工具”组合远远不够。以OpenDev为例,介绍了Harness架构,包括核心理念、扩展ReAct循环、上下文工程等,还提及安全架构、多模型路由等内容。
CapRL:用强化学习突破Image Captioning训练瓶颈,3B模型性能媲美72B
上海人工智能实验室联合团队发布 CapRL,首个将 DeepSeek - R1 强化学习策略用于 Image Captioning。CapRL - 3B 模型在图像描述任务媲美 Qwen2.5 - VL - 72B,已开源,团队持续迭代优化。
2025年哪款模型最受欢迎?Poe最新报告:DeepSeek降温、可灵成黑马
AI工具聚合平台Poe发布2025年1 - 5月人工智能模型使用趋势报告。显示模型市场份额消长明显,推理模型势头正劲,图像、视频、音频生成领域各有竞争态势,如DeepSeek降温,可灵成视频生成黑马。
阿里一口气发了N款新模型,让我们向源神致敬。
阿里云栖大会发布众多模型,如Qwen3-Max对标顶尖模型,Wan2.5支持音画同出,Qwen3-VL开源且跑分出色,Qwen3-Omni是全模态模型等。发布会上阿里股票涨飞,其构建了全模态、全场景超级生态。
WithAnyone重磅开源:这可能是你见过最自然的AI合照模型
复旦大学携手阶跃星辰推出全新AI合照生成模型WithAnyone,它能生成自然、真实、毫无违和感的AI合照。该模型打破以往方法局限,当前ComfyUI版本已上线,还全面开源代码、模型权重等。
拒绝视频生成,深度跃迁提出具身基座模型全新路线
深度跃迁发布世界动作模型 DELE - w0.5,放弃基于视频生成模型的路线,训练时联合学习动作与未来世界表征,推理时移除该表征分支。在真机实验中表现超基线,具跨背景泛化能力,为世界模型提供新思路。
对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」
本文是对IDEA研究院张磊的深度访谈。张磊在计算机视觉领域成就斐然,他指出具身智能落地需攻克成功率、泛化性等挑战,大脑比本体更关键。还阐述了世界模型概念及应用,定义其应具备动作依赖等内容。
中国AIGC「全家桶」来了!三箭齐发杀入全球第一梯队
3月27日,2026中关村论坛上,天工AI发布游戏世界模型Matrix - Game 3.0、视频大模型SkyReels V4和音乐大模型Mureka V9,杀入世界第一梯队,解决行业顽疾,还发布2026 AGI战略。
其实,扩散语言模型在最终解码之前很久,就已确定最终答案
随着扩散语言模型(DLM)发展,它成自回归(AR)模型有力替代。但实际推理慢于 AR 模型。研究者发现早期答案收敛现象,提出 Prophet 策略,实验显示其能在保持高质量生成时显著加速推理。