「训练环境」共找到 2523 篇相关文章
智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析
智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。
传Claude sonnet 5即将发布:能自动组建开发团队,一人即一公司,价格爆降50%
小道消息称Anthropic下一代AI模型Claude Sonnet 5或于北美时间2月3号发布,代号“耳廓狐”。它有全新功能,能化身虚拟开发团队,编程能力强,价格将降50%,还与谷歌深度合作。
美国视频生成老炮儿,入局世界模型
Runway发布首个通用世界模型GWM - 1及一系列变体,包括GWM Worlds、GWM Avatars、GWM Robotics,均基于Gen - 4.5构建。还对Gen - 4.5升级,新增原生音频生成、编辑和多镜头编辑功能。
谷歌智能体发力:增强版Gemini Deep Research和专属API都来了
OpenAI强势更新,谷歌也没闲着。正式发布增强版的Gemini Deep Research,配套推出DeepSearchQA基准测试集,还发布了Interactions API,这不仅是Deep Research升级,还是Gemini生态的大升级。
打破显存墙:谢赛宁团队提出CLM,单卡RTX 4090「撬动」1亿高斯点
3D Gaussian Splatting (3DGS) 是流行的新视角合成方法,但显存容量限制其应用于大型复杂场景。谢赛宁团队提出 CLM 系统,基于 3DGS 稀疏性和空间局部性,减少通信开销,可在单卡 RTX 4090 渲染大型场景。
jiSGLang集成ktransformers:2TB内存运行Kimi K2 Thinking模型
对于内存多但GPU资源有限的用户,SGLang集成ktransformers的CPU内核,支持直接运行Kimi K2 Thinking模型。它无需等量化,还能微调,虽性能与GPU方案有差距,但给用户新选择。
「我受够了Transformer」:其作者Llion Jones称AI领域已僵化,正错失下一个突破
颠覆性论文《Attention is all you need》作者之一Llion Jones在TED AI大会称厌倦Transformer。他认为AI领域资源多但创造力降,过度聚焦单一架构或错失重大突破,建议调高‘探索旋钮’并分享结果。
蚂蚁开源 Ring-1T,成就推理、编程、通用智能三冠王
蚂蚁开源团队推出 Ring-1T 模型,它结合强化学习与多阶段推理机制,实现从‘模仿’到‘思考’的转变。该模型在多基准测试表现优异,其高性能得益于 IcePop、C3PO++、ASystem 三项关键技术。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
可能是目前效果最好的开源生图模型,混元生图3.0来了
腾讯混元发布并开源原生多模态生图模型混元图像3.0,参数规模80B,是参数量最大的开源生图模型,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型。文中介绍其技术方案、测评效果等。