「多模态视觉语言模型」共找到 2255 篇相关文章
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
在参与OpenAI、Google、Amazon的50个AI项目后,他们总结出了大多数AI产品失败的原因
Aishwarya Naresh Reganti 和 Kiriti Badam 参与超50个企业级AI产品构建。他们指出,如今AI产品构建成本降低,但多数仍失败。还分享开发陷阱与路径,如从低自治高控制起步、建立CC/CD框架等,也对AI未来发表看法。
永别了,互联网!Anthropic联创爆料:人类彻底出局
Anthropic联创Jack Clark警告熟知的互联网正在消亡。Moltbook作为专为AI智能体打造的社交网络,预示未来互联网将由智能体主宰,人类会感孤独,或需翻译智能体解读局面。
LLM时代的事件抽取:从静态任务到认知脚手架
此综述论文探讨LLM时代事件抽取价值,认为其未被削弱,应视为“认知脚手架”。它系统梳理任务分类、方法演进等,还提出六大未来研究方向,指向将其演化为智能感知与记忆层。
别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程
作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。
李飞飞万字长文爆了!定义AI下一个十年
李飞飞新文指出AI下一个前沿是「空间智能」,揭秘其「世界模型」核心框架和三大核心支柱。构建具备空间智能的AI需世界模型,其应用涵盖创意、机器人、科学医疗等领域,有望提升人类生活。
Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像化了
传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程化实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。
承认自己开源不行?转型“美国DeepSeek”后,两个谷歌研究员的AI初创公司融到20亿美元,估值暴涨15倍!
AI创业公司Reflection AI由两位前Google DeepMind研究员创立,仅一年就完成20亿美元融资,估值达80亿美元。它从编程领域起步,推出代码理解智能体Asimov,现转型为开源替代公司,要打造开放模型。
刚刚,全球AI生图新王诞生!腾讯混元图像3.0登顶了
LMArena竞技场发布文生图榜单,腾讯混元图像3.0夺冠,超越谷歌、字节和OpenAI等模型。它是原生多模态模型,语义理解强,核心技术独特,经多阶段训练,效果能与顶尖模型媲美。
Agent下半场!比Prompt更重要的是「上下文工程」,Anthropic首次系统阐述
Anthropic发文章阐述上下文工程,指出构建语言模型重点正从提示工程转向上下文工程,探讨了其与提示工程区别、重要性,给出实践指导原则、新趋势及应对长时程任务策略。