「端到端对话模型」共找到 8312 篇相关文章
一张图片+ 一条音频,照片开口说话唱歌,多角色、情绪控制都拿捏了。
腾讯混元联合腾讯音乐推出 HunyuanVideo - Avatar 模型,上传照片配音频就能生成动态视频。支持多风格角色、情绪控制和多角色对话,单角色模式已开源,技术有创新,在多数据集表现优。
Google 推出超小杯 AI:Gemma 3 270M!可进手机和浏览器
Google发布Gemma 3家族最小版本Gemma 3 270M,2.7亿参数,能耗低,在同规模模型中表现突出。设计理念是“够用就行”,适合特定任务,已在多平台发布,开源策略效果好。
谷歌新发现:DeepSeek推理分裂出多重人格,左右脑互搏越来越聪明
谷歌研究表明,DeepSeek - R1等顶尖推理模型解题时,内部会自发“分裂”出不同性格虚拟人格,像在进行社交、辩论会,且越“吵”越聪明。团队借助SAE解码其脑内群聊,还发现‘哦!’能提升推理准确率。
罕见!Meta、OpenAI、xAI联合分享了用生产环境提升LLM的最佳实践!
Meta、OpenAI、xAI联合发表成果CharacterFlywheel,聚焦在生产环境提升社交型AI对话能力。团队基于LLaMA 3.1迭代15个版本,7/8的A/B测试显示正向提升,介绍了架构、数据管道、奖励模型等内容。
加拿大丛林迷路五小时,ChatGPT救命神技,比地图还靠谱!
一群人在加拿大森林迷路5小时,手机电量低、Google Maps失灵,靠向ChatGPT发实时坐标获导航指引脱险。此外,上海交大团队推出PathGPT,用大模型让导航可自然对话,虽有不足但潜力大。
低延迟、高吞吐,LLM优化与高效推理引擎综述
LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。
如何做到在手机上实时跑3D真人数字人?MNN-TaoAvatar开源了!
阿里巴巴淘宝Meta技术团队研发的TaoAvatar技术,能在手机或XR设备实现3D数字人实时渲染与AI对话。今日开源MNN - TaoAvatar应用,可在手机运行,对比主流方案更高效便捷,还介绍其优势、技术及使用说明。
Claude:Profile and Preference
文章借与Claude对话,探讨Profile和Preference概念,分析其区别联系,指出AI时代借助大模型理解用户的变化,还谈及数据源、实时个性化、偶然性、广告变革等问题,最后Claude为作者生成简易画像。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
从 1000 万 App 下载到 1 亿桌面:千问与夸克合体成 AI 浏览器了
阿里千问 App 公测 7 天下载量破千万,其基于强大的 Qwen 模型。11 月 26 日,千问与夸克 AI 浏览器深度融合发布 6.0 版本,借助夸克超 1.1 亿的装机量,千问成系统级桌面智能助理。