视觉-语言生成」共找到 3493 篇相关文章

产品应用7

Vibe Coding 继续:这次,AI Studio 让你可以“画着改UI”

谷歌在AI Studio中引入注释模式,可乱涂乱画用注释命令修改,能更自然地更改应用,与Gemini进行直观视觉对话,还提到Cursor等IDE中类似功能实现方式。

AI进修生
开源动态8

开源SOTA!商汤原生多模态一个大脑完成看图、推理、作画

商汤开源日日新SenseNova U1,用NEO - unify架构让像素和文字自由协作,多项指标达开源SOTA,适配10家国产芯片。它能完成看图、推理、作画等多任务,虽有局限,但后续优化值得期待。

AIGC开放社区
新闻资讯8

苹果放王炸!开放大模型访问权、全家桶集成ChatGPT,人人能开发AI应用

苹果在“WWDC 2025”大会宣布在多设备集成Apple Intelligence功能,含ChatGPT图像生成等。开放基础模型访问权,开发者可开发适配应用。新功能将逐步开启测试,今年秋季部分用户可用。

AIGC开放社区
开源动态7

Meta把内部设计系统开源了,支撑内部13000+应用,专为Agent调优

Meta开源的Astryx大更新,改造成Agent适配设计系统。它已在Meta内部演进8年,支撑13000+应用,提供150+可访问、可主题化的UI组件及开发工具,让人和AI用同一套语言

开源AI项目落地
产品应用7

声音自然、接近真人,只要 3 秒音频就能完成声音克隆,可本地跑保护隐私的TTS!

Neuphonic出品端侧TTS模型NeuTTS,能在本地设备高效运行,无需云服务。它有真正端侧运行、低延迟、高质量自然语音等特性,支持多语言,项目还给出安装、使用方法及支持模型等信息。

GitHubStore
算法论文8

免训练加速61倍!陈怡然团队新作DPad:仅关注「彩票token」

杜克大学陈怡然团队新作DPad,发现扩散大语言模型关注少量「中奖」token,推理速度可提61 - 97倍,还增强模型语境学习能力。DPad免训练零成本挑关键信息,实现「少算多准」。

新智元
算法论文7

NICE59期 | Agent进入下一篇章!Alita:不靠人工预设,自己造MCP自我进化的AI

这篇论文提出让 Agent 主动创造解决 MCP 的工具实现自我进化,工具可网上检索或自主编写。Alita 做法更通用实效,还提出‘Agent 蒸馏’思想,其生成的 MCP 已用于‘manus’。

深度学习自然语言处理
算法论文8

Meta超级智能实验室首篇论文:重新定义RAG

Meta超级智能实验室首篇论文提出REFRAG框架,重新定义RAG。它通过“压缩、感知、扩展”流程优化LLM处理外部知识方式,最高将首字生成延迟加速30倍,且性能无损。

量子位
算法论文8

用雨伞「钓」无人机?首个针对自主目标跟踪闭环系统的物理攻击

加州大学尔湾分校研究人员用特制雨伞干扰无人机视觉系统,实现FlyTrap攻击,让无人机误判目标远去而失控俯冲。此攻击无需信号干扰,成功率超60%,有强泛化能力,揭示了AI感知系统安全隐患。

新智元
开源动态7

Skill开发黄金法则!谷歌放出5种智能体Skill设计模式

谷歌工程师研究Skill开发生态,浓缩出5条黄金法则与5种设计模式,包括工具封装器、生成器等,每种模式附可运行ADK代码,还能组合使用,助开发者构建更智能的Agent。

AIGC开放社区