视觉生成调优」共找到 2727 篇相关文章

产品应用7

颠覆金融分析!多智能体AI股票分析师震撼登场!

多智能体AI股票分析师登场,由股票分析与报告撰写两智能体组成,通过CrewAI框架协作。用Streamlit构建界面,结合YFinance等获取数据,可30秒内生成含买卖建议报告。

GitHubStore
算法论文8

DeepSeek点燃大模型效率之争,阶跃火速接棒:JetSpec让大模型解码速度最高提升近10倍

近期,DeepSeek发布DSpark,阶跃星辰发表JetSpec论文,二者聚焦大模型推理效率。DSpark关注验证效率,JetSpec从Draft生成本身入手。结果显示,二者都有加速效果,共同表明推理效率正成Agent落地关键变量。

量子位
开源动态7

MIT团队完成AI控制人类行为实验项目

MIT团队的Human Operator项目是实时人体增强工具,也是MIT Hard Mode 2026获奖项目。它通过视觉 - 语言模型结合电刺激肌肉实现人体运动控制,介绍了技术栈、环境要求、软硬件准备、安装步骤等。

GitHubStore
开源动态8

轻量级语音模型Vui开源,支持本地部署,笑声停顿全拟真,4万小时练出人类对话感!

近日,Fluxions - AI团队在GitHub开源轻量级语音模型Vui,可设备端运行。它能精准模拟语气词、笑声等,有三款模型,适用于语音助手、播客生成等场景,解决了传统模型的痛点。

开源星探
算法论文8

0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench作者新作把AI圈干沉默了

SWE - Bench创建者推出新benchmark ProgramBench,测试AI从零构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺全局系统规划能力,引发对其评估方式的讨论。

机器之心
新闻资讯7

我在OpenAI修中文

OpenAI研究科学家陈博远介绍GPT Image 2官网博客花絮,分享模型训练、测试情况,还展示亲手制作的官网图片,包括中文彩蛋、漫画、杂志页等,体现模型文字渲染、视觉推理等能力。

机器之心
算法论文8

ICCV 25 Highlight | 扩散过程「早预警」实现6x加速,AIGC生图的高效后门防御

随着AIGC图像生成技术流行,后门攻击威胁开源社区,传统防御技术难适配。本文作者来自多所高校,提出输入级防御框架NaviT2I,基于神经元激活差异检测样本,加速检测,性能优。

机器之心
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收

LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。

机器之心
算法论文7

复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」

多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。

量子位
产品应用7

谷歌 Gemini 的新功能 Storybook 很有意思.....

推荐大家体验谷歌Gemini的新功能Storybook,它能生成任何主题的有声故事绘本。如以动漫风格介绍马斯克生平、梳理ChatGPT诞生后的AI发展等,虽有转换性别等情况,但免费且想象空间大。

AI寒武纪