多场景隔离」共找到 5328 篇相关文章

开源动态8

阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!

2025 年 AI 圈风向变了,开始卷端侧模型。阿里 FunAudioLLM 团队发布 Fun - CosyVoice3 0.5B 和 Fun - ASR - Nano 0.8B,TTS、ASR 双线程开源,是工程级版本,目标是在本地跑顺‘听 + 说’。

开源星探
开源动态7

Karpathy组建大模型「议会」,GPT-5.1、Gemini 3 Pro等化身最强智囊团

前OpenAI联合创始人Andrej Karpathy发推称养成用LLM阅读习惯,还做了个新项目,让四个最新大模型组成LLM议会当智囊团。项目是Web应用,提问后模型处理,有互评和投票机制,已开源。

机器之心
产品应用8

AI不再「炫技」,淘宝要让技术解决用户每一个具体问题

技术发展迅速,淘宝力求将AI融入应用场景解决用户问题。今年3月升级AIGX技术体系,近日郑波公开淘宝全模态大模型进展,认为狭义AGI或5 - 10年到来,模态智能成关键技术域。

机器之心
新闻资讯8

Uber&WisdomAI揭露95%AI Agent落地失败的真相 !

在‘Beyond the Prompt’技术论坛上,Uber、WisdomAI等企业揭开AI智能体落地难症结。指出90%失败源于‘喂错料’,信任是落地‘生死线’,记忆是架构设计,模型编排与场景化交互决定用户体验上限。

CourseAI
产品应用8

面向UE5的智能数字人系统

GMTalker是光明实验室媒体智能团队为虚幻引擎5.3打造的智能数字人系统,集成种能力,适用于科研等场景。具备功能特点,与其他开源方案对比优势明显,还介绍了环境要求、启动方式、配置、API等。

GitHubStore
7

Google发布"Nano Banana"图像生成模型,号称全球第一

Google推出新图像生成和编辑功能,社区称其为‘Nano Banana’,号称‘世界第一’且免费开放。它有风格转换、背景编辑等亮点,用户反馈整体积极,但也存在API限制等问题,与对手有差距也有优势。

AI工程化
算法论文8

视频「缺陷」变安全优势:蚂蚁数科新突破,主动式视频验证系统RollingEvidence

蚂蚁数科AIoT团队论文提出主动式可信视频取证系统RollingEvidence,利用相机卷帘门效应嵌入物理水印,结合AI与概率模型验证,抵御伪造篡改,在检测准确率和防护能力上优于传统技术。

机器之心
开源动态7

Oxlint 1.0 稳定版发布:基于 Rust 的 JavaScript 静态检查器

Oxlint是基于Rust的JavaScript和TypeScript静态检查器,其1.0稳定版发布。它有快速检测、规则覆盖广等特点,性能比ESLint高50 - 100倍,能处理文件规则,开发者反馈积极。

InfoQ
算法论文8

0.016%参数撬动18%性能:关键表征微调破解LLM推理瓶颈

大语言模型在推理任务依赖思维链技术,传统PEFT方法需修改大量参数,新兴ReFT虽只需调整少量参数,但存在不足。本文提出CRFT,仅用0.016%参数量就提升性能,为轻量化推理增强开辟新路径。

深度学习自然语言处理
新闻资讯7

宇树王兴兴,A股上市辅导公告了

宇树科技创业九年正式冲刺A股上市,其创始人王兴兴持股情况曝光。公司估值超百亿,产品涵盖类型机器人,应用潜力大。当下具身智能领域投资火热,行业正迈向产业场景落地。

量子位