「视觉理解」共找到 1300 篇相关文章
AI遭遇灵魂拷问!这道题所有模型集体翻车,网友:我也不会啊
图像推理现新难题,在Reddit引发热议,目前无AI能真正解决。国内外支持图像输入的大模型答案不同,原因是对大立方体规格理解不同。结合提示多次尝试,部分大模型能找准方向,人类面对该问题也会困惑。
Qwen最新3.7 Max预览版空降!两代超大杯并行迭代,林俊旸走了但还在加速
Arena公布Qwen3.7-Max-Preview和Qwen3.7-Plus-Preview成绩,文本和视觉领域均为国产第一。Qwen3及以后迭代提速,大版本间隔缩至2-3个月,反映阿里Qwen团队进入快速实验、高频交付阶段。
实测Claude Opus 4.7,好好的模型也开始不说人话了。
作者实测Claude Opus 4.7,它已全渠道上线,价格不变。该模型有多处更新,如隐形涨价、视觉能力提升、审美进步,但也出现不说人话的问题,还新增了effort档位、/ultrareview命令和Cyber Verification Program。
刚刚,杨植麟亲自开源Kimi K2.5!国产大模型打架的一天
今天国产大模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。
上海AI Lab发布混合扩散语言模型SDAR:首个突破6600 tgs的开源扩散语言模型
上海人工智能实验室提出全新范式SDAR,通过‘训练 - 推理解耦’融合AR模型高性能与扩散模型并行推理优势。实验证明,SDAR性能与原版AR模型持平或超越,还能加速推理,且已全面开源全系列模型。
马斯克宣布:Grok学会看片了!无字幕看懂陶哲轩菲奖级难题
马斯克宣布Grok可分析任何视频。它能对伪造视频鉴假溯源,但也有处理画面靠字幕、有幻觉问题和效果不稳定的缺陷。实测中它能理解无字幕视频,还整理访谈内容。这功能虽便利,但引发人类能力退化担忧。
反超Nano Banana!OpenAI旗舰图像生成模型上线
OpenAI发布图像生成模型GPT - Image - 1.5,有更严谨指令遵循、精确编辑等亮点,速度快4倍。玩法类似Nano Banana,在指令遵守和精确编辑上有提升,将在ChatGPT面向所有用户推出,价格下降。但在世界理解能力上遭质疑。
Google Design.md:一键复刻60+大厂设计规范 | 设计界的事,能叫偷吗?
今天分享Google Stitch团队提出的DESIGN.md标准,单文件搞定网页设计。62个真实网站视觉语言对应的DESIGN.md可在https://getdesign.md/获取,它也是开源项目。放入项目根目录后,AI编程助手可读取生成风格一致的UI组件。
上帝视角!DeepMind提前5天锁定Melissa,强度预报不再靠天
飓风Melissa来临前,DeepMind算法提前5天预言其强度变化。该模型用两类数据训练,能生成多种未来场景,在路径和强度预测上优于传统模型,已被NHC投入实战,但AI不能理解灾难,人类仍需做决策。
真正的一句话修图:Gemini 用香蕉模型给出了图像生成的分水岭
Google新模型Gemini 2.5 Flash Image可在AI Studio体验。它有多图融合、角色一致性等能力,能实现自然语言编辑图像,速度快、价格低、API可用,虽有中文体验等问题,但有望让AI视觉工具进入工程化时代。