「视频 - 音频联合生成」共找到 2045 篇相关文章
专门收购和孵化无聊产品,年收入 3 亿美金的 Tiny 给了些启发
Tiny 通过收购孵化不起眼但赚钱的产品,成年收入 3 亿美金的控股公司。联合创始人 Andrew Wilkinson 分享创业见解,如选有利润空间的细分市场,初期选能快速获正反馈的生意,还谈到收购、管理等多方面经验。
刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。
智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。
支持中文!NotebookLM自动生成播客
Google宣布NotebookLM语言摘要功能支持50多种语言,包括中文,可将上传文档转成播客对话形式。以一篇AI进化论文为例展示效果,其音频和内容质量不错,学习输入立体,还能助力AI播客创作。
8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉
行业首个具备“高刷”视频理解能力的多模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在多任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。
蚂蚁专用模型超越o3!仅用2K训练样本刷新医疗AI榜单纪录
蚂蚁集团联合团队发布《MedResearcher-R1: Expert-Level Medical Deep Researcher》报告,其医学AI智能体MedResearcher-R1用2100条训练样本在医疗基准测试反超通用大模型,靠数据、工具、训练方法三大创新实现突破。
X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA
中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。
解码加速15倍!EdgeRazor助推大模型在PC/移动端“狂飙”
大语言模型参数膨胀,端侧部署难,量化成主流轻量化方案。开源工具库EdgeRazor由南京大学和微软联合推出,采用MPQAD打破极低比特大语言模型“能力塌陷”,在性能、效率、易用性等方面表现出色,打通AI全生态链路。
科研的回归:AutoSOTA如何终结“增量式优化”的重复劳动
当前AI科研中,为提升性能指标,研究者投入大量精力做“增量式优化”,限制原创探索。AutoSOTA项目由清华与中关村学院联合发布,它基于智能体系统构建自动化方案,接管实验迭代,一周发现105个SOTA模型,推动科研回归原创。
北京AIGC视听产业创新中心:“数字浮游”今日开展,AI视听实验室赋能艺术实践
2026年3月7日至5月5日,“数字浮游——第六届北京电影学院国际新媒体艺术三年展巡回展”在郎园Station X美术馆举办。该展由北京电影学院与X美术馆联合主办,汇集24位(组)艺术家的26件作品,呈现数字技术下的创作环境。
破局大模型训练黑盒,MegatronApp开源实现万亿参数「可视可控」训练
在2025上海QCon大会上,算秩未来赵伯罕博士指出万亿级大模型训练困境。上海期智研究院和算秩未来联合研发MegatronApp,以低入侵方式补齐链路,其四个模块形成闭环,让训练从黑盒变白盒,项目已开源。