可灵3.0」共找到 6015 篇相关文章

产品应用7

AI文本转语音进入“Next Level”!独角兽ElevenLabs发布Eleven v3:狠狠拿捏情感控制

独角兽ElevenLabs发布最新版TTS模型Eleven v3,支持70多种语言,能进行多人对话,生动展现情绪语气。官方称其为“迄今为止最具表现力的文本转语音模型”,网友实测好评居多,但中文效果不如英文。

量子位
开源动态8

性能逼近闭源最强,通义实验室开源Mobile-Agent-v3刷新10项GUI基准SOTA

通义实验室开源 Mobile-Agent-v3,覆盖多平台,7B 超同类开源,32B 挑战闭源强手。它有基于云环境的全链路开源方案、全栈 GUI 能力构建和扩展环境强化学习体系,降低部署开销。

机器之心
新闻资讯7

GPT-5.3爆更前夜,全网都被一张图吓到!ChatGPT人格大赏

OpenAI华人研究员Joanne Jang一条推文引发ChatGPT生图玩法热潮,它能根据聊天记录生成反映‘待遇’的自画像。近期ChatGPT记忆功能优化,已向全球Pro和Plus用户推出。还有爆料称GPT - 5.3要来了。

新智元
新闻资讯7

刚刚,马斯克Grok4干翻谷歌Gemini!o3杀入首届大模型对抗赛决战

首届大模型国际象棋对抗赛第二轮结果出炉,o3以4比0击败o4 - mini,Grok 4在加赛中战胜Gemini 2.5 Pro,二者挺进决赛。8月7日将迎来终局之战,国际象棋冠军将解说。

新智元
新闻资讯8

「幻觉」竟是Karpathy十年前命名的?这个AI圈起名大师带火了多少概念?

AI大牛Andrej Karpathy是命名大师,“幻觉”一词由他命名,2022年随ChatGPT火起来。他还提出软件2.0、3.0,氛围编程、细菌式编程等概念,转发带火上下文工程,平时推文也让一些问题受关注。

机器之心
开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许

量子位
开源动态8

首个MCP架构、只50行代码就能实现高效RAG的开源框架UltraRAG 2.0

检索增强生成系统(RAG)复杂度提升,使科研人员面临高昂工程实现成本。清华大学、东北大学、OpenBMB等联合推出UltraRAG 2.0,基于MCP架构,降低技术门槛与学习成本,让科研专注创新。

PaperAgent
产品应用8

更快更省!Vidu Q3硬核升级打响AI视频普惠第一枪 | 甲子光年

2026年AI视频行业内容产出增长迅猛,但成本上涨、生成慢等问题凸显。生数科技的Vidu Q3模型全面升级,生成速度提升5倍、价格降低,适配多场景,为AI视频普惠工业化提供范例。

甲子光年
开源动态8

2.6K Star!超逼真端侧TTS模型,0.5B参数3秒音频即时克隆!

文章介绍开源项目NeuTTS Air,它是免费、轻量级超逼真语音合成模型,仅0.5B参数,媲美商用TTS引擎,能在低功耗设备运行,支持3秒音频克隆声音,还给出使用步骤和应用场景。

开源星探
开源动态8

开源两周狂涨4.3K star!!这个能"隐身"的开源AI桌面助手,真的很6了~

介绍开源项目Glass,它是AI桌面助手,“隐身”不占空间,能将操作和对话变知识。支持macOS,Windows在测试。有实时会议记录等功能,安装简单,开源两周获4.3K star。

开源先锋