多轮视觉问答」共找到 794 篇相关文章

产品应用7

创新性自动化 AI 工具-终结者机器人

Terminator是最快的AI优先计算机操作SDK,用类似Playwright的API与Windows原生GUI应用交互,比基于视觉的方案更快更可靠,能操作后台应用。它重点支持Windows,部分支持macOS,暂不支持Linux。

GitHubStore
推荐文章7

AI Agent 十问十答,降低认知摩擦

文章以问答形式梳理技术术语与价值信息,介绍AI Agent定义、与传统软件区别、演进原因等,还阐述组件、原理、提升输出效果方法,探讨Workflow与LLM关系及单/多智能体系统相关内容。

阿里云开发者
算法论文8

文生图Scaling新变量,被字节Seed团队发现了

ByteDance Seed团队研究发现,文生图模型中自然语言Caption变长,不意味着模型获更多视觉监督,其信息量更能预测训练损失。团队提出Structured Prompt,从两侧提升文本条件,在多任务上取得显著提升。

机器之心
算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
推荐文章8

如何正确Vibe Coding?这是来自Anthropic编程智能体负责人的大师课

Anthropic研究员Erik Schluntz分享Vibe Coding经验。他认为AI能力指数级增长,开发者应接纳大模型生成系统,还提出聚焦‘叶子节点’、做好产品经理等策略,并介绍22000行代码合并案例及实战问答

机器之心
新闻资讯7

The Batch: 941|盲人辅助模型中的隐患

视障患者用AI评估外貌引发关注。失明记者Milagros Costabel撰文探讨用视觉语言模型作“虚拟镜子”的挑战与隐患,如AI会给出评判性反馈,心理学家担心这加剧抑郁焦虑。产品应提供客观解读。

DeeplearningAI
开源动态8

登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界

全球科技界正豪赌「世界模型」,但主流模型多停留在「视觉生成」。中国影溯公司发布并开源世界模型 InSpatio - World,综合性能优异,以小博大登顶权威榜单,降低了物理世界数字化门槛,引发行业关注。

机器之心
产品应用8

2秒终结AI 3D不可能三角,我们和VAST首席科学家曹炎培聊了聊

速度、质量、管线可用性是AI 3D生成的不可能三角。VAST发布的Tripo P1.0首次在原生三维空间概率生成,2秒输出专业3D资产,效率提升百倍,生成结果可直接用于多场景,突破了这一困境。

机器之心
开源动态8

千星项目LLMRouter:多模型路由,16+策略优化推理

UIUC开源智能模型路由框架LLMRouter,可自动为大模型应用选最优模型,有16+路由策略。该框架打通训练、评测等链路,解耦Route与Training模块,支持多轮协同等,还可插件式扩展。

新智元
产品应用8

安卓党狂喜!Open-AutoGLM让手机自己订外卖、抢票、刷小红书

Open - AutoGLM是能让手机自己干活的黑科技,给手机装了「AI打工人」。它整合视觉语言模型与ADB远程操控技术,适配50 + 款主流应用,自带安全边界,普通人易安装,开发者可自定义流程。

CourseAI