图像理解与生成」共找到 2974 篇相关文章

开源动态8

Github 1.8K star厉害!!有了这个办公AI神器,效率飙升!

Speakr是完全自托管的AI会议助手,能将音频转文字、生成摘要、进行内容问答,离线运行保障隐私和安全。它功能丰富且轻巧,支持多平台,GitHub已破1.8K star。

开源先锋
推荐文章8

深入原子世界,他在寻找材料失效的原因

文章介绍了美国宾夕法尼亚州立大学副教授杨洋的材料研究。他利用先进电子显微技术,研究材料在极端环境下微观过程,如空位、虫洞腐蚀和短程有序,旨在理解材料失效机制,推动材料设计优化。

DeepTech深科技
开源动态7

夯,还真的很不错,8.2k Star scroll-world,太丝滑~~~~

许多官网滚动特效不佳,scroll - world 让滚动驱动无切镜的品牌旅程。它通过生成镜头链、对齐接缝实现沉浸体验,还给出适用场景和接入方式,虽非零成本但复用了经验。

小华同学ai
算法论文8

AI 会笑吗?BIGAI & 上交大团队:多模态大模型是否真的能 get 到视频笑点|ACL 2026

上海交通大学等团队构建v-HUB评测基准,分析多模态大模型视频幽默理解能力。评测7个前沿模型发现,模型依赖文字、主动发现笑点能力弱,声音作用有限,还需考虑隐形线索。

AI科技评论
新闻资讯7

马斯克的最快AI模型来了

xAI发布Grok 4 Fast,生成速度每秒75个token,比标准版快10倍。网友实测其解题、问答速度惊人,但也有准确性问题。它为求速度做了妥协,适合追求即时结果的用户。

量子位
新闻资讯8

汤道生:腾讯持续加大 AI 投入力度,各项业务全面拥抱 AI

腾讯集团汤道生在 5 月 21 日峰会表示,生成式 AI 可用性质变,腾讯会加大投入,业务全面拥抱 AI。还提出‘四个加速’打造‘好用的 AI’,并介绍混元大模型、智能体等应用成果。

AI前线
产品应用7

能帮你做 Live Photo 了!藏师傅社交卡片 Skill 重磅更新

藏师傅社交卡片 Skill 重磅更新,新增 Live Photo 生成和编辑能力,可处理产品录屏等素材。介绍了能做的卡片类型、使用方法、适用场景,还提及制作细节及 Live Photo 的价值和安装更新方式。

歸藏的AI工具箱
产品应用8

从0到1带你速通 Marvis马维斯

AI 时代,Agent 产品虽强但普通用户使用门槛高。本文详细介绍腾讯 Marvis,它能让 AI 直接理解电脑,可执行多项任务。作者实测 6 个任务展示其功能,认为它是面向普通用户的系统级 AI 管家。

腾讯技术工程
算法论文8

一键开关灯!谷歌用扩散模型,将电影级光影控制玩到极致

Google推出LightLab项目,可从单张图像精准控制光影,解决传统光影控制难题。其通过特殊数据集微调扩散模型,让模型学会控制光照,还介绍了方法、后处理流程等,实验显示表现优,有多种应用。

机器之心
新闻资讯7

The Batch: 973|Claude 的水印如何运作

Anthropic将在2026年8月2日后发布的Claude模型全球部署肉眼不可见、机器可读的水印,用于表明文本和图像由其生成。该技术基于Google的SynthID - Text,不过此公告引发广泛争议。

DeeplearningAI