视觉 - 文本压缩」共找到 1202 篇相关文章

新闻资讯8

从傅盛的龙虾到汗青的加速主义,AIFUT大会Day1下午场总结都在这了。

AIFUT大会第一天下午场信息密度大。傅盛称龙虾是工具的AGI时刻;特效小哥008认为AI不替代人类但可能替代工作;辩论探讨教用AI能否教会;朱广翔说程序员岗位将减少,泛创造者会增加;李继刚指出人不可压缩的只剩体验;赵汗青探讨慢的东西如何存活。

数字生命卡兹克
产品应用7

专治AI生图「人脸崩坏」,8倍速碾压GPT!新版FLUX.1多方位刷新SOTA

FLUX.1 Kontext是融合即时文本图像编辑与文本到图像生成的新一代模型,支持文本与图像提示,角色一致性强,速度快达GPT - Image - 1的8倍。它能解决AI生图“人脸崩坏”等问题,评估显示性能优异。

新智元
产品应用8

Nano Banana Pro最全解析,设计师和开发者都用得上,附官方提示指南

Nano Banana Pro基于Gemini 3 Pro构建,将逻辑推理能力注入像素生成,解决画面准确性、逻辑性问题。它在多方面实现飞跃,应用广泛,谷歌还给出提示词使用技巧,但在部分处理上仍有提升空间。

AIGC开放社区
新闻资讯8

触觉具身来了个梦之队:天使轮近亿

5月27日,上海新智具身智能科技有限公司宣布完成近亿元天使轮融资。该公司源自复旦大学,核心团队实力强。它聚焦触觉具身智能,构建技术闭环,在数据采集、模型训练等方面有进展,已在工厂落地POC验证订单。

量子位
算法论文8

给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策

上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。

深度学习自然语言处理
产品应用8

看完最新国产AI写的公众号文章,我慌了!

AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。

量子位
算法论文8

脸谱心智陆弘远团队ACL 2026新作:别再给模型叠加「高级词」了!模型更爱听「大白话」

脸谱心智与香港中文大学科研人员中稿 ACL 2026 的新工作提出 Adam’s Law,即文本频率定律,揭示文本频率对模型训练及推理的重要性,还给出工程解法,实验效果显著,为行业带来新思路。

机器之心
算法论文8

模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作

北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。

机器之心
开源动态8

智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析

智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。

AIGC开放社区
开源动态8

一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一

文档OCR正迈入小模型时代,MonkeyOCRv2以0.7B、0.6B参数在MDPBench上超越3B模型。它重新分配系统职责,采用互补预训练目标,还开源训练数据,且迁移到多任务表现良好。

量子位