「音频大语言模型」共找到 7937 篇相关文章
蚂蚁开源万亿参数思考模型 Ring-1T,综合能力逼近 GPT-5、数学能力对标 IMO 银牌
10月14日凌晨,蚂蚁集团推出万亿参数思考模型Ring-1T并全面开源。它在多任务榜单表现均衡,数学能力达IMO银牌水平,通用能力逼近GPT - 5,还采用自研算法应对行业难题,目前可下载体验。
RSS 2025|物理驱动的世界模型PIN-WM:直接从视觉观测估计物理属性,可用于操作策略学习
国防科大、深圳大学、武汉大学团队提出物理驱动的世界模型PIN - WM,能从视觉观测辨识刚体物理属性。还提出PADC提升迁移性能,经实验验证其在非抓握式操作技能Sim2Real迁移中表现出色。
童年的滚球兽「走进」现实?华为天才少年创业,全球首个虚实融合的实时交互视频模型来了
Xmax AI 推出全球首个虚实融合实时交互视频模型 X1,通过手机摄像头实现虚拟与现实融合。它有四大玩法,操作简单。但面临多技术挑战,Xmax AI 团队实力强,给出硬核技术方案,愿景是让 AI 融入生活。
姚班传奇陈立杰入职OpenAI!16岁保送清华,30岁拿下UC伯克利助理教授
最新消息称姚班大神陈立杰加盟OpenAI负责数学推理。他16岁保送清华,30岁成UC伯克利助理教授,长期从事理论计算机科学研究,近期聚焦扩散语言模型。
美团重磅开源!13.6B通用视频生成大模型,能文生视频、图生视频、还能续写!
AI视频生成竞争激烈,美团团队在GitHub开源通用视频生成模型LongCat-Video,参数量13.6B,能文生视频、图生视频、视频续写,几分钟生成720p、30fps长视频,有核心优势,还介绍了安装部署等内容。
中国AI创业者重登GTC舞台:杨植麟用技术语言讲了一个智能上限突破的浪漫故事|甲子光年
美国当地时间3月17日,月之暗面(Kimi)创始人杨植麟在英伟达GTC演讲,介绍Kimi技术路线图。他提出开源模型要出色,给出Token效率、长上下文、智能体集群三个概念,还探索了未来架构,且将创新开源。
10人创业团干翻行业“潜规则”!全员必须会AI、让跑大模型全程“裸奔”,谷歌老兵不烧钱创业
在AI创业浪潮中,谷歌老兵Bryan Zhou带领10人团队创立AnyInt平台。该平台定位AI Infra中间件,一个API对接所有模型,提倡“去中心化”,让用户付费,还在工程、安全等多方面优化,吸引开发者付费。
一次汇报,资源投入暴涨数十倍:快手大模型推荐以 1/12 成本突围,技术负责人亲历的革新故事
InfoQ 专访快手科技副总裁周国睿,他分享了快手大模型推荐技术投入挑战、决策过程等。如汇报后资源投入涨数十倍,以 1/12 成本突围。还阐述推荐系统变革、技术押注及未来推荐系统突破点等观点。
告别VAE压缩损耗,南京大学用DiP让扩散模型回归像素空间,实现10倍加速与SOTA级画质
南京大学、腾讯优图实验室和新加坡国立大学发布DiP框架,即将开源。该框架不依赖VAE,仅增0.3%参数量,推理提效10倍,在ImageNet获1.79的FID分数,解决扩散模型在像素空间难兼顾质效的问题。
消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存
消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。