视觉交错推理」共找到 2544 篇相关文章

开源动态8

支持30种语言,多种中文方言 [四川话、粤语等]的颠覆性无分词器TTS系统

VoxCPM是无离散音频分词器的语音合成系统。VoxCPM2基于MiniCPM - 4构建,有20亿参数,支持30种语言和9种中文方言,具备音色设计、可控声音克隆等特性,还完全开源,商用就绪。

GitHubStore
新闻资讯7

谷歌看了都沉默:自家「黑科技」火了,但为啥研发团队一无所知?

当科技圈为‘谷歌黑魔法’兴奋时,所谓‘并行验证循环’可能是AI生成的‘赛博跳大神’。它号称超越思维链,性能提升显著,但发帖者身份存疑,无可靠源链接,其真实性遭业内质疑。

新智元
算法论文8

Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识

Meta推出「自由Transformer」新模型,打破自2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后自回归时代。

新智元
推荐文章8

69 页最新报告丨AI Agent 圣经:智能体的终极指南

AI Agent 定义下一轮科技创新浪潮,众多公司积极布局。CBINSIGHTS《AI Agent Bible》报告梳理其前景趋势,含六大预测与生态版图,解析市场格局等,还展示智能体重塑企业运营方式。

特工宇宙
8

无限长、零掉帧!StableAvatar口型同步全新技术

当前音频驱动头像视频生成扩散模型合成长视频时难兼顾音频同步与身份一致,瓶颈在音频建模。复旦大学提出StableAvatar,首个端到端视频扩散Transformer,能无限时长生成,还介绍原理与演示效果。

带你学AI
新闻资讯8

12秒生成1万token!谷歌推出文本「扩散模型」Gemini Diffusion,研究员:演示都得降速看

谷歌将图像生成常用的“扩散技术”引入语言模型,推出Gemini Diffusion,12秒能生成1万tokens,速度比Gemini 2.0 Flash - Lite更快。它通过逐步优化噪声学习生成输出,目前是实验性演示,可申请体验。

量子位
算法论文8

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。

机器之心
开源动态7

Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小

Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。

InfoQ
算法论文8

北航,清华,北大联合发布: 异构智能体协同强化学习!

北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。

机器之心
新闻资讯8

从Transformer到GPT-5,听听OpenAI科学家 Lukasz 的“大模型第一性思考”

2017年《Attention Is All You Need》提出Transformer架构,重塑AI版图。其作者“Transformer八子”中,Lukasz Kaiser加入OpenAI,参与GPT-4、GPT-5等研发。他10月将出席大会分享见解,曾预言多模态等趋势已渐成现实。

AI科技大本营