图像生成加速」共找到 2930 篇相关文章

产品应用8

谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...

谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。

AI寒武纪
开源动态8

AI版权侵权难以“定罪”?Copyright Detective:首个集成多范式检测的交互式版权取证系统

随着生成式AI广泛应用,版权纠纷成AI领域棘手挑战。张登辉等研究人员推出Copyright Detective系统,集成多范式检测,解决单一检测局限,为大模型文字版权风险提供全方位“体检”方案。

深度学习自然语言处理
推荐文章8

多尺度特征融合:原理、结构与实用算法案例

文章介绍多尺度特征融合技术,它结合网络不同层次特征以捕获丰富上下文信息,在目标检测等任务广泛应用。阐述原理、常用方法,介绍FPN、U - Net等结构,并给出基于这些结构的实用算法案例与Python代码。

机器学习AI算法工程
产品应用7

Claude Code 推出语音功能,但是,不支持中文

Claude Code推出语音模式,向约5%用户开放。用户按住空格说话,系统自动生成文本,支持语音与键盘混合输入,能提高录入效率,但大概率不支持中文。此外,电报率先支持OpenClaw流式实时回复。

AGI Hunt
算法论文8

给GRPO加上运筹外挂让7B模型比肩GPT-4!Li Auto团队发布多目标强化学习新框架 | ICASSP 2026

文本摘要质量评估需兼顾多维度,但开发者优化时易顾此失彼。Li Auto团队提出HVO,基于GRPO框架,让7B模型在摘要任务媲美GPT - 4,且生成内容更简洁,成果被ICASSP 2026接收。

量子位
产品应用8

用嘴聊出来了一个 APP:实测「码上飞」语音开发有多离谱

本文实测「码上飞」AI 开发平台,它让用户用对话或语音描述需求,AI 就能做出应用。测试了美甲预约、AI 生图、私域自媒体知识付费小程序三个场景,它表现出色,大幅压缩开发成本,助普通人跨过技术门槛。

特工宇宙
新闻资讯7

GPT-5.2破解数论猜想获陶哲轩认证!OpenAI副总裁曝大动作:正改模型核心设计,吊打90%研究生但难出颠覆性发现

OpenAI 发布由 GPT - 5.2 加持的科研平台 Prism 并免费开放。OpenAI 副总裁 Kevin Weil 回应入局科研领域问题,称模型能力超 90% 研究生,但难有颠覆性发现,还透露将优化模型设计。

AI前线
新闻资讯7

2026年,腾讯正式用元宝派杀入了AI社交。

2026年开年,腾讯用元宝派进军AI社交赛道。元宝派玩法新颖,有独特社交体验,还能与元宝交互,如生成图片、总结消息、制定日程等。虽内测有小毛病,但未来可期。

数字生命卡兹克
算法论文8

AMS | 西工大向锦鹏、宋述芳等:一种用于伴随方程求解的物理约束图神经网络

伴随方法用于高维优化问题,但求解伴随方程代价大。本文提出物理约束图神经网络(ADJ - PCGN),构建流场解与伴随向量映射模型,有精度和泛化性,能加速优化,方便嫁接求解器。

力学与人工智能
产品应用8

通用级PixVerse P1的技术突破,揣着进入平行世界的密码

PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。

机器之心