「原生多模态长思维过程」共找到 1337 篇相关文章
对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”
阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。
文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”
港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。
当 Agent 尝试接管浏览器,连“我是人类”都证明不了?上海交大开源发布交互评测基准 HLL
随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。
AI眼镜不再依赖手机!这次真要单飞了
2026年AI硬件出货量飙升,但操作系统仍受GUI时代旧秩序束缚。乐奇Rokid在Rokid Open Day 2026上提出AIOS原生智能眼镜操作系统及AIUI交互标准,重构YodaOS,还搭建应用商店,构建开放生态。
北大光华院长最新对谈:未来奖学金可以用 Token 发
5月12日晚,北大光华管理学院院长田轩与Kimi总裁张予彤就‘AI时代的边界探索与人才机遇’展开对谈,探讨了AI带来的新工作、学生培养、企业管理、人才招聘等问题,张予彤提出诸多独到见解。
2 天斩获 3.5K 标星!GitHub 惊现神器!一个二进制文件把 DeepSeek V4 搬进终端
GitHub上的DeepSeek TUI项目开源两天获3.5K Star,它把DeepSeek V4模型搬进终端成编码智能体,有原生RLM并行推理等亮点,提供多种安装方式、支持多提供商,适合终端开发者。
我用 Moxt,开了一家 AI 公司
作者体验 Moxt 后,用其创建 AI 团队做炒股分析、开发产品、设计桌游。Moxt 是 AI 原生协作平台,AI 同事有持久记忆,Workspace 灵活。个人和团队用它能提升效率,实现与 AI 深度共事。
迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路
多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。
CVPR2026 | 鬼手想点谁就点谁?LaSM让GUI智能体把注意力「收回来」
文章聚焦弹窗式环境注入攻击,指出多模态智能体易受环境干扰致目标漂移。提出 LaSM 方法,通过放缩关键层权重让智能体注意力回到任务,实验显示其提升防御效果,且对正常任务影响小。
开源两天斩获 1.8K Star!把网站变成命令行工具,支持国内外主流平台!
OpenCLI是开源的AI原生命令行工具,能把网站或Electron应用变命令行接口,复用Chrome登录状态,安全性高。支持19个主流平台,有自修复配置等亮点,还介绍了安装、使用、诊断及下载方法。