单模态建模」共找到 279 篇相关文章

算法论文8

ACL 2026|清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成!

现有文生音频技术在精细化控制方面有挑战,清华团队提出ControlAudio方法。它通过数据构造、渐进式训练和引导采样,在统一框架下实现时间与语音内容联合建模,在多项任务上表现优于现有方法。

机器之心
开源动态8

10 分钟 CLI 化任何网站,AI全网一键调用!

AI Agent上网难,传统爬虫易遇反爬问题。开源项目`bb-browser`通过模拟真实浏览器登录操作,支持36个平台、103个命令,能绕过反爬,还可在浏览器内运行JS等,在GitHub获4.5k+ star。

开源先锋
算法论文8

SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”

北邮、北大等团队提出 AV-NAS,在多模视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。

AI前线
开源动态8

蚂蚁抛弃向量推荐!用8B小模型构建「用户“话”像」,实现跨模型通用并拿下SOTA

2026年AI开发者关注爆款大模型应用,个性化是关键。蚂蚁集团和东北大学团队推出AlignXplore+,实现文本化用户建模新范式,有全域通用、极致迁移、实战适配特性,小参数超越基线,未来将继续探索。

量子位
新闻资讯7

用DeepSeek网页版就能瓜分鹅厂600万??!

腾讯营销以KDD Cup 2026官方赛道身份出题,聚焦推荐系统统一建模,奖金600万+。全球众多选手参与,学术和工业赛道各有冠军方案,还设创新奖。赛事也推动了鹅厂人才培养体系的拓展。

量子位
算法论文8

改变强化学习范式,Meta新作呼应Sutton「经验时代」预言

图灵奖得主等提出AI智能体将迎「经验时代」,但训练面临挑战。Meta研究用「早期经验」范式解决问题,包含隐式世界建模和自我反思,提升了智能体任务成功率和泛化能力。

机器之心
算法论文8

Snapchat提出Canvas-to-Image:一张画布集成 ID、姿与布局

Canvas-to-Image 是面向组合式图像创作的全新框架,将不同控制信息整合在同一画布,简化图像生成控制流程。它解决了传统生成流程中控制方式分散的问题,能在推理阶段组合多种控制信号,实验效果良好。

机器之心
算法论文8

Being-VL的视觉BPE路线:把「看」和「说」真正统一起来

北大、UC San Diego 和 BeingBeyond 联合提出 Being-VL 的视觉 BPE 路线,先将图像离散化并「分词」,再与文本统一建模,能缩短跨模链路、保留视觉结构先验,还介绍了实现步骤、训练方式等。

机器之心
算法论文8

ICCV 2025 | RobustSplat: 解耦致密化与动的抗瞬3DGS三维重建

3DGS技术成研究热点,但现有方法在含动物体场景建模精度不足。中山大学等研究者提出RobustSplat,有延迟高斯生长和尺度级联掩码引导两大核心设计,实验显示其在多指标上领先基线方法。

机器之心
算法论文8

ACL 2025 | AI字幕慢半拍,不知道大家在笑什么?新方法让同传性能直逼离线翻译

香港中文大学、字节跳动Seed和斯坦福大学团队提出SeqPO - SiMT框架解决同声传译“质量 - 延迟”权衡问题。该方法将同传建模为序贯决策过程,优化决策序列,实验显示其性能直逼离线翻译。

机器之心