「文本转图片」共找到 698 篇相关文章
上海AI Lab、浙大EagleLab等提出RRVF:利用「验证非对称性」,只输入图片学习视觉推理
上海AI Lab、浙大EagleLab等联合完成研究,提出RRVF框架,利用「验证非对称性」,仅输入图片学习视觉推理。它构建闭环系统,通过迭代推理、视觉反馈等步骤训练模型,实验显示效果佳,证明验证法则力量。
北大团队提出 SHINE:将任意文本转化为大模型 LoRA,仅需一次前向传播!
北大团队提出全新超网络架构 SHINE,仅需一次前向传播就能将任意文本转化为大模型 LoRA 参数,支持多轮对话。该方法实用潜力大、架构创新高效,训练流程成熟,推理快速,为大模型持续学习提供新思路。
打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”
上海人工智能实验室 OpenDataLab 团队发布 MinerU.Chem 技术报告及成果,升级化学文献智能解析能力。它能将化学文献图片转化为 AI 可用数据,解决化学知识机器难用问题,在评测中领先,还将助力 AI4S 发展。
即梦图片4.0来了,我整理了10个好用到爆的进阶玩法。
字节即梦图片4.0背后是seedream4.0模型,与NanoBanana性能相当,但支持直出4K图、自由控比例、文生图审美和可控性强,中文字生成领先。文章整理了它在虚拟模特、换装等10个方面的玩法。
微软炸场了!一张图片仅需3即可生成带完整PBR材质的超高质量3D资产!
微软推出3D资产生成大模型TRELLIS,能接收文本或图像提示,输出高质量3D资产。其结果质量强,支持灵活切换输出格式和局部3D编辑,还给出安装和使用方法及项目地址。
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练
美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。
面壁MiniCPM4端侧模型发布:长文本推理 5 倍提速,0.5B 模型拿下新SOTA
2025智源大会,面壁发布MiniCPM4.0端侧模型,含8B稀疏闪电版与0.5B款。其采用InfLLM架构,实现长文本推理5倍提速、最高220倍加速,还在性能、部署等方面优化,适配多芯片与框架。
大神Karpathy炮轰复杂UI应用没有未来,Adobe首当其冲,网友:不提供文本交互,就是在阻挡AI浪潮
大神Karpathy预言只有复杂UI界面、不提供文本交互的应用将被淘汰,还点名Adobe、CAD。他言论引发讨论,支持者强调后端接口,反对者认为专业软件有其价值。此外,他还批判大模型编程‘重生成轻判别’。
长文本推理 5 倍提速!面壁MiniCPM4 端侧模型发布,0.5B模型效果秒杀同级
近日,面壁发布 MiniCPM4.0 端侧模型,有 8B、0.5B 两种规模。其在基准测试表现出色,长文本推理提速,缓存锐减,还做了架构创新。此外,面壁有自研推理框架,科学化建模产线,6 月 27 - 28 日 AICon 北京站将探讨 AI 趋势。
小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一
6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。