「多模态论文」共找到 1878 篇相关文章
实测全新 SkyReels :AI 创作,终于连成了一体
当前AI生成技术虽强,但视频创作仍门槛高、流程琐碎。昆仑万维推出全新SkyReels,是多模态创作系统,AI科技评论实测其画布、Agent等功能实用,它依托统一框架,核心竞争力在实现“统一性”。
从「会说」迈向「会做」,LLM下半场:Agentic强化学习范式综述
过去LLM训练多依赖PBRFT范式,但局限明显。2025年初起,Agentic RL新范式受关注。此综述论文梳理该方向,覆盖500+研究,构建理论框架,讨论未来挑战,助LLM从「会说」迈向「会做」。
AI发现医生看不见的隐藏心脏病风险,近90%准确率远超人类专家|Nature子刊
登上《Nature》子刊的研究显示,约翰霍普金斯大学团队开发的多模态AI模型MAARS,用深度学习处理原始MRI图像,实现对心源性猝死风险高精度预测,准确率达89%,还能辅助制定个性化医疗方案。
真正能用好AI的企业是怎么做的?(附企业级AI落地实战手册)
数字化深入,非结构化文档成企业难题。合合信息发布白皮书,提出复杂文本智能五大核心能力标准,用11个行业标杆案例展示多模态文本智能技术应用,提供可复制落地范本。
近期,不错的LLM Agent统一记忆框架综述~
随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据集复现比较10个方法,还设计出新的低token开销框架。
谷歌DeepMind曝光首个“AI 经济体”完整架构,Agent催生全新经济体正在悄然成形
谷歌DeepMind论文描绘由AI Agent自主交易和协作的经济体,提出“沙盒经济”框架,分析其起源与隔离程度,指出发展方向及挑战,还给出应用场景、市场机制、设计方案、基础设施层和行动建议。
“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%
文章聚焦多模态长文档视觉问答,介绍现有LVLM - based和RAG - based技术路线及困境。提出MMRAG - DocQA方案,引入‘分层索引 + 多粒度检索’,设计双索引建模相关性与依赖,用互补策略实现证据互补。
EMNLP2025 | 揭开LLM训练数据中的中文污染真相,有比“您好”高2.6倍的token?
近年来,大型语言模型虽成功,但训练数据易混入不良内容。论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》探索此问题,定义PoC Token,开发PoCDetect和PoCTrace工具,揭示LLMs训练数据污染情况。
香农与 Claude
本文介绍信息论之父Claude Elwood Shannon,他1948年发表论文创立信息论,发明“比特”概念,信息从此可精确测量等。他还造了杂耍机器、无用机器、会走迷宫的电子老鼠等。Anthropic用他名字命名产品Claude。
记忆罗盘:大模型智能体记忆的表征、操作与演进航向 | 直播预约
记忆对基于大语言模型的智能体迈向通用人工智能至关重要。来自多所高校及华为的研究团队分析超30000篇论文,提出记忆表征与操作分类坐标系,绘制记忆罗盘指明演进航向。2025.12.24有相关直播。