开源动态7
智谱GLM 4.6V让图文混排Agent起飞
探索AGI
AI 摘要
作者介绍智谱多模态开源周的图文并排应用,上传PDF论文能生成优质图文混排解读。作者复刻代码发现GLM 4.6V有知道图片精确位置、一次输入几十张图片、基于裁剪结果持续迭代等能力。
阅读原文 · 探索AGI
从大模型到多模态,图文混排Agent彻底起飞~
上周智谱多模态开源周,从GLM 4.6v到Autoglm,其图文并排使用场景很吸睛。上传PDF论文,它能生成图文混排解读文章,效果好。作者逆向原理复刻代码,还分享GLM 4.6V三个有意思的能力。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
阿里开源Qwen3.8-27B,性能直逼顶尖模型
阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万。其性能超Opus4.6,与顶尖模型相当,量化后普通电脑就能跑,原生多模态,编程、Agent、多模态跑分表现出色。
AIGC开放社区
新闻资讯8
林俊旸携新公司押注Agent赛道
前阿里Qwen负责人林俊旸创办Pragmatik Labs/语用科技,研究跨数字与物理世界的下一代agent。红杉中国、高榕创投领投,腾讯等跟投。其目标是用agent实现终极生产力,有独特技术底色与愿景。
PaperAgent
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心
开源动态8
Qwen3.8-Max下周开源,能力全面提升
Qwen3.8-Max是Qwen家族迄今最强模型,2.4万亿参数,下周将开源权重。它在多项基准测试中表现出色,能连续自主工作数天,在编程、办公、科研、长周期任务、多模态等方面全面提升。
AIGC开放社区