算法论文8
Being-VL:统一「看」与「说」的视觉BPE路线
机器之心
AI 摘要
北大等联合提出 Being-VL 视觉 BPE 路线,先图像离散化「分词」再和文本统一建模。实现分三步,采用三阶段训练。实验表明其稳且有效,在细节问答和抗幻觉上更可靠。
阅读原文 · 机器之心
Being-VL的视觉BPE路线:把「看」和「说」真正统一起来
北大、UC San Diego 和 BeingBeyond 联合提出 Being-VL 的视觉 BPE 路线,先将图像离散化并「分词」,再与文本统一建模,能缩短跨模态链路、保留视觉结构先验,还介绍了实现步骤、训练方式等。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
紫东太初GMC:少80%Token保多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
量子位
产品应用8
阿里「千问办公」公测,Qwen3.8 - Max上岗
8月,阿里「千问办公」开启公测,它整合三款产品,还接入最新旗舰Qwen3.8 - Max。该产品交付成果可用,可一站生成多模态内容和Office产物,与钉钉打通且有组织级Skill,优势明显。
新智元
产品应用8
Agnes AI实测:编程瓶颈在缓存命中率
本文实测Agnes AI,指出AI编程瓶颈在于缓存命中率,而非模型智商。介绍其产品线、评测成绩与价格优势,还分享客户端体验,包括亮点、回滚事故及日志结论,最后点明智能免费后验证更稀缺。
AI科技评论
开源动态7
pxpipe:压缩Fable 5上下文,大幅降成本
Fable 5在AI圈爆火,但使用成本比其他型号贵至少5倍。pxpipe项目把适合压缩的大段文本渲染成PNG图片,交给多模态模型读取,能大幅降低成本,还能增加上下文长度。
开源AI项目落地