视觉tokenizer」共找到 1238 篇相关文章

算法论文8

给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策

上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。

深度学习自然语言处理
产品应用8

看完最新国产AI写的公众号文章,我慌了!

AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。

量子位
算法论文8

何恺明首个语言模型:105M参数,不走GPT自回归老路

何恺明团队推出全新连续扩散语言模型ELF,不走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。

量子位
算法论文8

模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作

北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。

机器之心
新闻资讯8

杨植麟当主持人的大模型圆桌:张鹏罗福莉夏立雪都放开说了

中关村论坛上,杨植麟、罗福莉、张鹏、夏立雪、黄超齐聚,共论agent的下一代演进。各位大咖观点硬核,如罗福莉认为中国大模型团队优势在‘算力受限下的最优解能力’,张鹏解释智谱新模型涨价原因等。

量子位
开源动态8

智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析

智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。

AIGC开放社区
开源动态8

一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一

文档OCR正迈入小模型时代,MonkeyOCRv2以0.7B、0.6B参数在MDPBench上超越3B模型。它重新分配系统职责,采用互补预训练目标,还开源训练数据,且迁移到多任务表现良好。

量子位
开源动态8

MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4

MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。

深度学习自然语言处理
开源动态8

超长推理还能节省计算!Salesforce开源神器两连发:教大模型边想边省,显著提升数学编程准确率

Salesforce AI Research开源Elastic Reasoning和Fractured Sampling。前者将推理流程分两部分,分配token预算,使输出缩短、准确性提高;后者打碎推理链条,从三维度采样,以更少tokens换更高准确率,均提升数学和编程任务准确率。

量子位
开源动态7

像原始人一样和AI对话,费用可直接砍掉40%

开源项目‘caveman-compression’能帮使用ChatGPT API或其他大模型的用户省钱。原理是删废话留关键信息,有调用OpenAI和本地NLP两种压缩方式,不同场景省钱效果不同,还介绍了使用方法。

AI工程化