「实时生成技术」共找到 4824 篇相关文章
腾讯重磅开源!端到端视频音效生成模型HunyuanVideo-Foley
腾讯混元正式开源端到端视频音效生成模型 HunyuanVideo-Foley,适用于多场景。它采用新型框架结合 REPA 策略,有三大核心优势,能适配多种场景,抑制底噪,保证音频保真度。
刘陈立领衔!六国学者联合发布亚洲合成细胞技术路线图
由刘陈立牵头的联合团队发表论文,提出亚洲合成细胞技术路线图。它指出构建合成细胞的四大挑战,提出新型研究范式和十年两阶段目标,体现亚洲科研协作原创探索,推动国际合作。
智谱联合清华开源多图参考视频生成模型,带来主体一致性新高度
合肥工业大学、清华大学和智谱开源多主体参考视频生成模型Kaleido。它用全新数据构建法和精巧架构,解决主角与背景混淆难题,实验显示其在多维度表现优异,超越现有开源模型。
AI 会生成 PPT 之后,Runtime 决定了它能做多好
作者回顾PPT Agent发展,指出存在Agent理解操作文档及AI生成PPT表达单一的问题。提出Artifact Runtime概念,它让PPT可被持续操作,还能接管重复决策,但不能替代专业判断。
谷歌翻译重大更新:实时翻译,全球无障碍交流摩擦苹果
Google搜索产品副总裁宣布Google翻译引入Gemini模型,翻译能力飞跃。更新含顶尖文本翻译、实时语音对话翻译(Beta版)及扩展语言练习功能,适用多平台多语言,谷歌期待用户反馈以优化体验。
狂肝一周,测评十余款 PPT AI 生成产品的真实反馈
评估 Agent 产品能力复杂,以 PPT 生成为例,有 Agent 和模板化两种流派。作者选前者投票测评、后者全方位测试。给出方案,还推荐不同需求适用产品,附总榜单和细致体验描述。
谷歌北大联手学术版Banana爆火,论文图表100%精确生成
谷歌与北大联手推出学术版PaperBanana,能100%精确生成论文图表,美观度和逻辑清晰度超原版。它由5个智能体分工协作,经实验在各维度超越传统基线方法,已在GitHub获上千star。
一个大脑搞定所有模态,百度ERNIE 5.0技术报告公布
模型发布近3个月后,百度ERNIE 5.0技术报告公布。其底座用超级稀疏架构,参数量万亿但推理激活参数不到3%,实现四种模态原生自回归统一,还在路由调度、训练范式等多方面有创新。
屏下光谱颜色传感技术:开启环境智能感知的新纪元
智能机流行带来蓝光伤眼问题,手机屏幕技术变革,引入屏下光谱传感。艾迈斯欧司朗举办论坛分享成果,其开发的OLED屏下光谱颜色传感器,能精准重构XYZ响应,解决行业难题,获多方认可。
全球自动驾驶激战,滴滴与清华走出一条技术新路
2026年全球自动驾驶竞赛白热化,Waymo高歌猛进,特斯拉遇困境。滴滴与清华合作,成立实验室,发布STAPO算法,打通产学研链路。滴滴自动驾驶低调务实,掌握全栈技术,将出海阿联酋,其主业优势保障稳健发展。