「说话人识别」共找到 1347 篇相关文章
谷歌 AI Studio 实时视频对话终于支持中文了!屏幕共享+语音,Gemini 2.5 Flash 原生音视频加持。
谷歌AI Studio实时视频对话支持中文,有Gemini 2.5 Flash原生视频对话模型。使用方便,还提供多种音色,有让模型在无声时发音视频等功能,可用于设计、学习、修电脑等场景。
中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考
上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。
苹果把OpenAI窃密细节全部暴露!但草台班子拼音都搞错了…
苹果与OpenAI窃密大战更新,苹果提交初步禁令申请及相关材料,指控OpenAI员工多次蓄意窃密。OpenAI回怼,称苹果虚构协商叙事,其指控无据,还质疑苹果权限管理。此前马斯克也曾起诉OpenAI。
AI时代的人才,我觉得最重要的是这6点特质。
作者结合招聘与创业经历,分享AI时代人才应具备的6点特质:好奇心、靠谱、有事实洁癖、多元化思维、能忍受不确定性、低ego高自驱。强调特质比技能更重要,与学历无关。
GPT-5.6曝光了!OpenAI砸钱宣战:换掉Claude Code
GPT-5.5发布三周,GPT-5.6曝光且进入开发全速阶段,预计下月亮相。OpenAI本周四将上线「ultrafast模式」,速度提升2 - 3倍。Codex与Claude Code全面开战,OpenAI砸钱吸引开发者,AI自我加速与商业化形成正反馈。
穿越100年前打造的AI,不知道二战和互联网,却从几个例子学会了Python
前OpenAI研究成员等打造出130亿参数的时代语言模型talkie,只用1930年前英文词元训练。它不知二战等现代信息,能从例子学Python,风格似20世纪绅士,研究团队将扩大其规模。
Canva可画联合创始人独家专访:2.65亿用户的Canva,用自研模型,解决了设计的审美问题
Canva月活2.65亿,在a16z排名第三。4月16日开启Canva AI 2.0内测。联合创始人Cameron Adams称,自研模型结合14年数据是护城河,Magic Layers功能验证其价值。Canva要成用户进入AI入口,还会在中国持续投入。
剪辑 Agent 字幕升级:99% 正确率的字幕,一条指令直接推进剪映
作者成峰重做剪辑 Agent 字幕功能,结合 capcut - mate 项目,接入语音识别服务等优化流程。字幕准确率最高达 99%,还介绍了 5 步使用方法,解决非技术用户使用门槛问题。
大厂都在卷千亿大模型,这家深圳企业却专啃“最后一公里”
在CITE 2026上,佑泰创始人张希立分享企业战略。佑泰与大厂不同,走差异化路径,聚焦算力落地“毛细血管”,产品覆盖多应用方向,还将转型提供完整算力服务,积极布局信创,面对成本压力坚守契约。
NeurIPS事件发酵,多位学者拒绝出任AC
NeurIPS因美国法规不接收华为等受制裁实体投稿,引发学术界震荡,许多学者不满。中国计算机学会发声反对,呼吁学者拒绝服务与投稿,已有学者拒任领域主席,还引发对其他会议的担忧。