「视觉框架」共找到 2177 篇相关文章
Claude设计师被工程师卷到掉队,反手造出百万用户工具
Anthropic产品设计师Nate Parrott复盘Claude Design诞生过程。起初他在工作中被工程师拉开差距,利用业余时间捣鼓出这一工具。它以HTML为突破口,融入品牌系统,从副项目转正,定位前期视觉沟通。
跨越落地鸿沟!清华长三院发布首个真实场景AI竞技场,实战谁是最佳?
2026年AI产业冰火两重天,清华长三角研究院发布RWAI开源框架与“真实场景AI竞技场”。RWAI还原真实交互,实践效率高。竞技场重实际效能,产生多个赛道“擂主”,降低产业AI落地试错成本。
AIA | 西工大马启悦,高传强等:物理指导的激波抖振抑制翼型优化设计研究
激波抖振影响飞行品质、限制飞行包线。本文提出物理指导的气动优化设计框架,基于DDPG算法,优化RAE2822翼型激波位置与分离区范围,提升抖振起始边界,改善综合气动性能。
让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」
在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。
中心动态重分配哈希,北邮团队提出并开源CRH项目 | AAAI 2026
北京邮电大学等机构联合提出新颖端到端框架 CRH,在训练哈希函数时动态更新哈希中心,提升检索精度和语义一致性。论文被 AAAI 2026 收录,代码已开源。
Github 1.8k star Skyvern:AI直接接管鼠标键盘,3行API干掉你写了3年的脆弱XPath脚本!
Skyvern是开源AI浏览器代理,结合LLM和计算机视觉,自动执行浏览器业务流程。它用简单API复刻人工操作,替代传统脚本,解决脚本脆弱、流程复杂等痛点,功能丰富,技术优势明显,适合多业务场景。
自动化浏览器
Skyvern是能自动化浏览器操作的工具,底层靠大语言模型和计算机视觉。它提供简单API接口,可在大量网站自动化手动操作,替代易出错的自动化方案。介绍了其原理、使用方法、功能等。
生成视频总出物理bug?用VLM迁移+token级对齐,让燃烧在正确位置发生,碰撞遵循动量守恒丨CVPR 2026近满分接收
现有生成式视频模型多停留在“外观拟合”,未真正“物理建模”。中山大学等机构提出ProPhy,构建渐进式物理对齐框架,使模型有“分层物理理解”与“空间物理对齐”能力,论文被CVPR2026近满分接收。
Talking-Critic奖励模型带来更自然的音频驱动肖像
近期音频驱动肖像动画技术发展快,但现有方法存在嘴型声音不对、动作不自然等问题。阿里提出Talking - Critic奖励模型,构建Talking - NSQ数据集,还提出TLPO优化框架,提升多维度表现,实验超现有SOTA方法。
本周六直播预约 | Test-Time Reasoning综述分享!
当大模型训练成本飙升、数据枯竭,推理阶段扩展Test-Time Scaling(TTS)成研究热点。论文提出四维正交分析框架,梳理主流技术路线,提炼发展路径,给出操作指南与未来思考,本周六将直播分享该综述。