多模态知识获取」共找到 1509 篇相关文章

产品应用8

拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?

多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。

AI科技评论
推荐文章7

大概念模型:AI 推理的新范式

大概念模型(LCM)是自然语言处理新范式,侧重结构化推理和理解,与 LLM 不同。它依赖结构化知识,可模拟专家思维,解决当前 AI 缺陷,文章还介绍其架构、应用、局限,探讨与 LLM 结合的未来发展。

InfoQ
开源动态8

狂涨 36.9K star!!看看人家的开源微信机器人多优雅,微信、飞书、钉钉支持,效率飙升!

开源君介绍超火的开源项目`chatgpt-on-wechat`(CoW),它结合大模型与社交、办公平台,可定制优化。能接入多平台,支持多模型,处理多模态消息,有丰富插件,还能记忆会话、定制知识库。给出安装步骤。

开源先锋
新闻资讯7

大模型之后,AI 开始“自己动手”了

从生成式AI到Agentic AI,互联网从“信息获取”转向“任务完成”。全球科技巨头抢滩智能体,国内腾讯云升级智能体开发平台。腾讯吴运声表示,技术与业务需求双轮驱动其发展,还分享了应对落地挑战的办法。

AI科技大本营
算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心
推荐文章7

什么是系统提示词?如何逆向提示词?

大语言模型启动时会接收系统提示词,决定其角色、回答风格与安全边界。提示词逆向是试图获取或绕过该提示的行为。本文介绍其作用、逆向手法及开发者防御措施,助于安全使用和设计大模型。

AI Reading Hub
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
开源动态8

港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

香港科技大学(广州)联合腾讯AI平台部提出VibeWorlding,是可通过多轮对话等自主构建和编辑交互式3D世界的多模态智能体框架。团队开源多项数据,其模型经强化学习后表现超GPT - 5.5等。

机器之心
产品应用8

Claude Opus 5 发布:Fable 5 一半的价格,更强的编码能力

Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,价格是 Fable 5 的一半。它在编码、知识工作和推理上表现出色,虽有不足,如速度慢、幻觉率较高,但提供多种 effort 等级,成本低,安全对齐性好。

AI工程化