开放架构」共找到 2377 篇相关文章

开源动态7

开源端到端语音大模型:直接从原始音频输入,生成语音输出

目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。

AIGC开放社区
产品应用8

从0到1拆解FreeWheel ChatBI:大模型如何重塑视频广告智能数据分析新生态

本文结合 FreeWheel 实际应用经验,分享构建 ChatBI 系统核心实践。介绍其核心功能、技术实践,如让 LLM 理解业务、智能选表等,还提及系统架构、算法服务,最后总结上线效果并展望未来优化方向。

InfoQ
新闻资讯7

AI进化三年,产业落地真拐点可能就在这场全球顶尖金融智能赛事里

AI发展三年走到关键转向点,应用价值成关键。金融行业是AI应用复杂领域,AFAC2025金融智能创新大赛聚焦解决产业真问题,设百万奖金池,开放多赛道赛题,已开启报名。

机器之心
产品应用8

极客说|AI Sales Avatar 探索

本文介绍名品车AI数字导购Vendy搭建过程,以TEN平台为中枢,集成Agora、Azure等五大平台,构建具备听、说、想、演能力的AI数字销售助理,还给出后续扩展建议,推动企业AI转型升级。

AIGC开放社区
新闻资讯8

Veo 3全网实测惊艳所有人!DeepMind CTO:规模是AGI全部吗?

谷歌推出视频生成模型Veo 3,一句提示词就能打造电影质感短片,还能音画同步,引发网友惊叹。DeepMind CTO在访谈中表示,规模非AGI唯一要素,还提及Deep Think模式及Veo 3进展等。

新智元
开源动态7

炸裂!微软开源Windows子系统

今天凌晨微软宣布开源适用于Linux的Windows子系统WSL。它能让开发者在Windows上运行Linux环境,无需虚拟机或双引导。还介绍了WSL工具、架构及文件共享机制,回顾其发展历程。

AIGC开放社区
产品应用8

实测腾讯Hunyuan-Image2.0,首个毫秒级实时图像生成模型

今天上午腾讯发布混元图像2.0,以“更智能、更开放、更中国”为理念。其参数规模提升,推理时间大幅压缩,实现毫秒级实时生成,还在画面质量等方面升级,新增实时绘画板功能。

带你学AI
开源动态8

完全开源的7B模型,性能比肩主流LLM,训练成本仅16万美元,复现DeepSeek的强化学习!

Moxin-7B由多机构团队联合开发,遵循“开源科学”原则,公开全流程细节。它训练成本仅16万美元,评测表现亮眼,在架构、数据策略、训练过程等方面有创新,为中小企业提供可控AI方案。

AI科技大本营
开源动态8

公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族

英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。

机器之心
产品应用8

梅涛的视频AI创业,最新产品来了

本文来自量子位,对梅涛旗下智象未来发布的AI视频创作智能体Vivago R1进行深度实测,介绍产品定位、技术架构,分析AI视频赛道分化路线,分享实测体验,探讨AI创作工具发展方向。

量子位