多模态玩法」共找到 1446 篇相关文章

新闻资讯7

Claude 活动上这台巴掌大的电脑,被疯了

上周Anthropic在开发者大会上,让参会者用Claude Code为巴掌大的M5Stack Cardputer ADV写程序,会后官方展示五个小项目,如摇一摇切换MacBook模式、拼写游戏等,代码开源,设备可带回家。

AGI Hunt
开源动态7

Google开源DESIGN.md。AI,今年最该知道的Markdown!

Google开源DESIGN.md格式规范,对用AI coding的人很实用,可约束产品UI设计。开源社区已有70+大厂的DESIGN.md及自动提取的开源项目。还有汇聚大厂设计规范的仓库及可自动生成的工具,或成行业标准。

探索AGI
产品应用8

GPT-Image-2正式发布!设计师可以告别「古设计」了

OpenAI正式发布ChatGPT Images 2.0(GPT - Image - 2),它是首个具“思考”能力的图像模型,处理复杂任务能力强,实测在商品广告、论文海报等场景表现出色,已全量上线,在大模型竞技中领先。

量子位
新闻资讯7

当心!腾讯、字节等揭示,OpenClaw有无修复的安全死结

加州大学等机构团队发布对OpenClaw安全的深度分析报告。它是广泛部署的个人伴侣智能体,运行依赖进化理念,但记忆文件成攻击入口。研究在真实网络测评,发现其安全漏洞大,且难以找到进化与安全的完美平衡。

AIGC开放社区
开源动态7

装完Hermes Agent了一圈,我觉得龙虾已死!

Hermes Agent势头正猛,被视为龙虾以来首个真正的竞争对手。它让Agent自己做Harness Engineering,自己写、用、改Skill,还能自我迭代。文章介绍了安装使用方,对比了与其他项目的差异。

探索AGI
开源动态8

NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!

英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。

带你学AI
算法论文7

BLIP3-o统一图像生成与理解,多模态融合趋势显现

BLIP3 - o致力于统一图像理解和生成,提升生成质量与效率。它融合自回归和扩散模型,采用CLIP + Flow Matching架构等。经训练,在图像理解和生成任务表现佳,指令微调效果显著。

CourseAI
算法论文7

!AI模仿人类‘空像错觉’,开启想象力之旅

越南国立大学提出Shape2Animal框架,模仿人类‘空想性错觉’,将自然物体轮廓转化为动物图像。该框架经多阶段流程,结合多种技术生成画面,但也继承了基础模型的一些局限性。

带你学AI
算法论文7

BLIP3-o统一图像生成与理解,多模态融合趋势显现

BLIP3 - o致力于统一图像理解和生成、提升生成质量和效率。它融合自回归与扩散模型,采用CLIP + Flow Matching架构等技术亮点。经训练,在图像理解和生成任务表现出色,指令微调效果显著。

CourseAI
推荐文章7

搞不懂Skills?看看Claude Code内部工程师们是怎么

文章来自Anthropic的Claude Code团队工程师,介绍了Claude Code中Skills功能。阐述Skills定义、类型,给出制作技巧,如避免陈述显而易见内容、构建陷阱部分等,还提及分发、管理、组合及衡量效果的方

机器之心