「视频大语言模型」共找到 8395 篇相关文章
百度搜索 10 年来最大改版,支持超千字长文本输入和 MCP 调用
7月2日,百度搜索宣布十年来最大改版,搜索框变“智能框”,支持超千字输入,集成AI写作等功能。“百看”功能、AI助手升级,接入视频生成模型MuseSteamer,还接入1.8万+MCP,提升搜索体验。
Self-evolving Agents过程并非总是良性的,要警惕这些“错误进化”风险
近年来,基于大语言模型的智能代理成为热点,自进化代理可自我改进。但论文指出其进化可能“跑偏”,出现“错误进化”,并揭示了不同进化路径的风险,还提出缓解策略,呼吁重视其安全性。
面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟
面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。
Meta出走华人创业团队,种子轮800万美元,要打造视觉AI记忆大脑
由前Meta顶尖科学家创立的Memories.ai获800万美元种子轮融资。其大视觉记忆模型LVMM解决AI‘记忆缺失’问题,在多领域刷新SOTA基准,应用潜力大,还开放API及网页应用。
第二代AI预训练范式:预测下个物理状态
英伟达科学家Jim Fan发布文章《第二代预训练范式》指出,当前以LLM为代表的AI模型基于「对下一词的预测」,在物理世界应用中「水土不服」,第二代范式应是「预测下一个物理状态」,引发机器学习社区讨论。
真正能离线跑的完全开源翻译工具
Argos Translate是用Python写的开源离线翻译引擎,底层靠OpenNMT,推理用CTranslate2。可当库、命令行、桌面软件用,模型是本地zip包,不联网也能用。支持主流及小众语言,有多种使用方式。
手机跑多模态也能快到飞起!面壁MiniCPM-V 4.6开源
面壁智能开源多模态模型MiniCPM-V 4.6,以低算力成本、超低首Token延迟打通三大主流手机操作系统。它算力瘦身性能强,是视觉语言多面手,还适配主流系统,降本增效,让AI能力从云端到指尖。
【开源】build-your-own-x:30+领域造轮子教程,程序员内功提升指南
开源项目 build-your-own-x 收录 30+ 领域「从零造轮子」教程,解决学编程只知用不知原理的问题。涵盖 3D 渲染、AI 模型等多领域,多语言可选。介绍学习好处、使用方法,还推荐优质教程。
Sora 死了,OpenAI 正在变成另一家公司
OpenAI 宣布关停 Sora App 及 API,放弃视频生成业务。此前 Sora 虽曾火爆,但下载量和收入迅速下滑,还面临版权问题。OpenAI 正转向下一代模型和企业级工具,以应对竞争、IPO 和算力压力。
Transformers来到了v5时代:从工具包到真理之源,AI时代的操作系统内核的极简进化论
Transformers v5发布,通过极简定义和极致互通成AI生态核心。它做减法重构代码、拓展训练流程、成推理引擎弹药库、提升量化为核心功能,连接训练、推理与部署,是AI生态通用语言。