「训练路径」共找到 2583 篇相关文章
Google 发了个压缩算法,内存砍 6 倍,速度快 8 倍,精度零损失
Google Research发布TurboQuant压缩算法,将在下月ICLR 2026正式发表。该算法把大模型的KV Cache压缩到3 bit,内存降6倍、速度快8倍且精度零损失,解决了传统算法的压缩开销问题。
CVPR 2026|清华联合美团推出3DThinker,首个用3D意象思考的工作
当前多模态大模型在空间理解任务表现弱,缺乏对几何信息提取能力。清华联合美团推出3DThinker,无需3D标注和外部工具,让模型内蕴‘想象’三维场景,在多基准上提升效果,且具备一定可解释性。
智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析
智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。
传Claude sonnet 5即将发布:能自动组建开发团队,一人即一公司,价格爆降50%
小道消息称Anthropic下一代AI模型Claude Sonnet 5或于北美时间2月3号发布,代号“耳廓狐”。它有全新功能,能化身虚拟开发团队,编程能力强,价格将降50%,还与谷歌深度合作。
包含一个 75+ AI 工程项目!所有内容100%开源
此 GitHub 仓库含 93+ 生产级 AI 项目,覆盖大语言模型、RAG、Agent 等主题。有不同难度项目及教程,适合各水平人士,还给出新手入门学习路径,采用 MIT 许可。
SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”
北邮、北大等团队提出 AV-NAS,在多模态视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模态融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。
2.8K Star!基于Nano Banana Pro的Vibe PPT神器!
GitHub上的banana - slides项目很火,近一周涨2K+ Star。它是基于Nano Banana Pro的Vibe PPT生成工具,不强调套模板,能将想法、氛围和内容结构转成幻灯片,还具备多种强大功能。
打破显存墙:谢赛宁团队提出CLM,单卡RTX 4090「撬动」1亿高斯点
3D Gaussian Splatting (3DGS) 是流行的新视角合成方法,但显存容量限制其应用于大型复杂场景。谢赛宁团队提出 CLM 系统,基于 3DGS 稀疏性和空间局部性,减少通信开销,可在单卡 RTX 4090 渲染大型场景。
我有听书障碍,但被这个 AI 电台拿捏了
作者曾有听书障碍,却被 Huxe 这款 AI 音频 App 吸引。它由 Google 团队打造,能将邮件摘要、新闻等生成“私人电台”。有个性化简报、自定义音频内容等功能,集成 ASR、NLP 和 TTS 模块。
蚂蚁开源 Ring-1T,成就推理、编程、通用智能三冠王
蚂蚁开源团队推出 Ring-1T 模型,它结合强化学习与多阶段推理机制,实现从‘模仿’到‘思考’的转变。该模型在多基准测试表现优异,其高性能得益于 IcePop、C3PO++、ASystem 三项关键技术。