语音输入法」共找到 821 篇相关文章

开源动态7

3.3k星星!用AI做前端动效最好的开源项目,给AI写前端代码注入灵魂

现在AI编程做的前端效果不佳,页面不生动、特效生硬。而Text-to-Lottie开源框架可通过AI编程Agent快速生成生产级Lottie动画,支持多种输入,有实时预览与编辑功能,还能集成多平台,简化动效开发。

开源AI项目落地
新闻资讯7

社区供稿丨Hugging Face创始人 x 小红书技术副总裁:关于开源、AI与技术人成长

今年1024程序员节,小红书技术副总裁凯奇、语音模型技术负责人风龙与Hugging Face联合创始人Thomas Wolf深度对谈。围绕AI Coding、开源、AGI等核心观点展开,探讨开源闭源、AGI未来、AI人味及个人能力等话题。

Hugging Face
算法论文7

高效大规模创新3D重建模型iLRM

多数基于Transformer架构的模型处理多视图输入有可扩展性问题,成均馆大学、延世大学研究人员提出创新3D重建模型iLRM。它通过迭代细化机制生成3D高斯表示,有独特架构设计和高效注意力机制。

AIGC开放社区
产品应用8

实测 MiniMax H3:开源“斩杀线”蔓延到视频模型圈

本文实测 MiniMax H3 视频模型,它 8 月 3 日开源,成本低至 0.5 元/秒,在编辑榜成绩佳。它定位全模态生成,能多素材输入。实测效果好,价格约为 Seedance 2.5 的三分之一,还支持原生剪辑,适配多芯片与工具。

特工宇宙
算法论文8

谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建

字节Seed康炳易团队的最新研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简单,能从多种输入中精准算出物体深度、还原相机位置,在新视觉几何基准上表现出色,核心秘诀是极简设计。

量子位
开源动态7

MIDAS:快手可灵发布实时交互式数字人生成框架

近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。

带你学AI
推荐文章7

具身智能需要从ImageNet做起吗?

文章探讨具身智能发展,分析其爆发原因,如人类无完全数字化等。指出几种失败模式,还讨论输入信号、触觉、学习方等决策点,认为具身智能的‘ImageNet’时刻是伪命题,不同智能领域可能殊途同归。

海边的拾遗者
产品应用8

2.4万亿参数原生全模态,文心5.0一手实测来了

文心5.0正式发布,主打原生全模态,支持全模态输入和输出。官方测试显示其多维度表现突出,在LMArena文本排行榜并列全球第二。实测其理解精细、能捕捉细节,技术上采用自回归统一结构和超大规模混合专家架构。

量子位
算法论文7

手机上实现AI视频实时生成,DiT模型上移动端

扩散变换器在视频生成任务性能强,但计算成本高,在手机上难实用。Snap提出创新优化,加速视频生成,能在iPhone 16 Pro Max上每秒超10帧,不过也存在细节退化等局限。

带你学AI
算法论文8

能效翻5倍!他们复刻人脑双记忆通路,造出能长效记住上下文的类脑AI芯片

帝国理工学院博士后孙鹏飞和苏黎世联邦理工博士后苏哲及合作者,受大脑皮层机制启发,打造“双重记忆路径”类脑网络及配套芯片,处理语音识别任务时能效比此前优方案高5倍。相关论文发表在《自然·机器智能》且代码、设计全开源。

DeepTech深科技