结构化文本」共找到 1540 篇相关文章

产品应用8

美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练

美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。

量子位
产品应用8

面壁MiniCPM4端侧模型发布:长文本推理 5 倍提速,0.5B 模型拿下新SOTA

2025智源大会,面壁发布MiniCPM4.0端侧模型,含8B稀疏闪电版与0.5B款。其采用InfLLM架构,实现长文本推理5倍提速、最高220倍加速,还在性能、部署等方面优,适配多芯片与框架。

AI科技大本营
算法论文8

何恺明新作:给扩散模型加正则,无需预训练无需数据增强,超简单实现性能提升

何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。

量子位
产品应用8

Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间

Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。

AGI Hunt
算法论文8

AI for Science开年新突破:中科大实现多尺度结构逆向设计128倍加速,登上Nature子刊

中国科学技术大学联合多所院校,在多功能双连通多尺度结构逆向设计领域取得突破,成果发表于Nature Communications。研究解决核心瓶颈,提供新范式,在多方面展现优势与潜力。

机器之心
新闻资讯7

大神Karpathy炮轰复杂UI应用没有未来,Adobe首当其冲,网友:不提供文本交互,就是在阻挡AI浪潮

大神Karpathy预言只有复杂UI界面、不提供文本交互的应用将被淘汰,还点名Adobe、CAD。他言论引发讨论,支持者强调后端接口,反对者认为专业软件有其价值。此外,他还批判大模型编程‘重生成轻判别’。

量子位
产品应用8

文本推理 5 倍提速!面壁MiniCPM4 端侧模型发布,0.5B模型效果秒杀同级

近日,面壁发布 MiniCPM4.0 端侧模型,有 8B、0.5B 两种规模。其在基准测试表现出色,长文本推理提速,缓存锐减,还做了架构创新。此外,面壁有自研推理框架,科学建模产线,6 月 27 - 28 日 AICon 北京站将探讨 AI 趋势。

AI前线
算法论文8

3D生成告别「穿模」噩梦!VASTx清华将蒙皮权重Token,统一生成骨骼与权重,GRPO微调形变平滑

3D模型生成容易,让它“动起来”难,传统AI蒙皮算法有局限。SkinTokens研究将蒙皮权重离散,构建TokenRig框架,引入GRPO算法,提升了AI自动绑定精度和泛能力,助力3D动画自动生产。

量子位
开源动态8

小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一

6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。

AI前线
开源动态8

B站出海的强有力支柱:最新开源文本转语音模型IndexTTS-2.0标志零样本TTS进入双维度时代

B站Index团队开源文本转语音模型IndexTTS - 2.0,引发关注。它解决了传统AR模型时长控制难题,实现零样本TTS双维度控制,在多方面表现优异,为B站出海及AIGC应用奠定基础。

机器之心