视觉错觉图」共找到 897 篇相关文章

开源动态8

超过GPT-image-1!大黑马Black Forest刚开源新模型,只用文本实现一键PS

今日凌晨,Black Forest开源文生模型FLUX.1-Kontext开发者版本,功能类似PS,用自然语言就能一键P。测试显示它超GPT-image-1,成最强开源文生模型之一,还在架构、训练、工程层面做了优化。

AIGC开放社区
算法论文7

机器狗能当羽毛球搭子了!仅靠强化学习从0自学,还涌现出类人回位行为 | Science子刊

苏黎世联邦理工学院团队让机器狗靠强化学习学会打羽毛球,开发全身视觉运动控制策略,使其最高挥拍速达12米/秒,还涌现类人回位行为,研究证明足式机器人在体育场景应用可行。

量子位
产品应用8

PolarDB Supabase 助力 Qoder、Cursor、Bolt.diy 完成 VibeCoding 最后一公里

Vibecoding是开发者追寻的理想境界,但常被各种‘摩擦力’打断。PolarDB Supabase提供‘零摩擦’后端基础,通过MCP Server填平前后端断层,还能与Qoder、bolt.diy集成,提升开发效率,文末介绍其构建数据分析应用方案。

阿里云开发者
开源动态8

像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来

AI像编辑中扩散模型有两大难题,智象未来团队提出全新自回归像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。

量子位
开源动态8

刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。

智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。

数字生命卡兹克
产品应用7

豆包可以跟你打视频了,陪我看《甄嬛传》还挺懂!难倒一众AI的“看时钟”也没难倒它

国产AI豆包发布视频通话新功能,能实时报准时钟时间,还接入联网搜索,准确性和时效性强。实测中,它可当看剧搭子,还能识别食材、解答物理题等,背后是豆包·视觉理解模型在发力。

量子位
推荐文章7

团队授权:分散化的架构决策

文章以黏菌创建网络为隐喻,探讨软件团队去中心化架构决策。介绍转型历程,包括重组团队、建立建议流程、创建上下文等,阐述各环节作用、挑战与收益,强调其能提升决策质量与团队参与度。

InfoQ
开源动态7

爆火全网FLUX.2重磅上线,开源版Nano Banana来了!

Black Forest Labs的开源视觉模型FLUX.2上新,是专为现实创意工作流程打造的生产力工具。与前代相比,实现从「会画」到「懂你要画什么」跃升,还能在多方面保持一致性,各变体有不同定位与场景。

新智元
新闻资讯8

李飞飞自曝详细创业经历:五年前因眼睛受伤,坚定要做世界模型

在a16z播客节目中,“AI教母”李飞飞讲述创业经历。五年前眼伤失立体视觉,让她意识到其对空间交互的决定性作用。她认为真正通用智能需理解物理世界,与Martin Casado一拍即合创立World Labs,加速世界模型突破。

量子位
算法论文8

别再乱调像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」

浙大陈静远教授课题组等提出自适应非对称适配器,放弃对像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。

AI科技评论