多模态提示框架」共找到 2825 篇相关文章

开源动态8

AI Agent也有体检中心了?诊断级安全框架AgentDoG正式开源

上海人工智能实验室今日开源全球首个具深度诊断能力的AI智能体安全护栏框架AgentDoG。它能精准定位风险、解释决策成因。团队提出三维风险分类法,构建数据合成管道,实验表现领先,还集成归因模块。

PaperAgent
算法论文8

KDD 2025 Best Paper Runner-Up | EI-BERT:超紧凑语言模型压缩框架

香港城市大学王茂林等提出 EI - BERT 框架,解决移动设备部署 NLU 模型难题。通过硬令牌剪枝、交叉蒸馏、模块化量化,实现 99.5% 压缩率。在多任务中表现出色,已在支付宝大规模应用。

机器之心
开源动态8

1w颗星!多平台 LL M 聊天机器人及开发框架AstrBot!

AstrBot是聊天机器人及开发框架,松耦合、异步,支持多消息平台部署。它功能丰富,支持多种大语言模型,有Agent能力、插件扩展等,还介绍了多种部署方式、平台及提供商支持情况。

GitHubStore
算法论文8

多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降

多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。

新智元
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。

CourseAI
产品应用8

Claude Opus 5发布,砍掉了Claude Code 80%的系统提示

Anthropic发布Claude Opus 5,接近Claude Fable 5智能且价格减半,测评成绩出色,科研和视觉输出能力也有进步。同时发现砍掉Claude Code 80%系统提示词,编码评测分数不变,还总结出上下文工程新方法论。

AIGC开放社区
新闻资讯7

OpenAI员工爆料:已抢先体验GPT-5!7月上线,疑似完全多模态

新智元报道,X上神秘爆料与网友灰度测试经历让GPT - 5讨论再升温。奥特曼称今年夏天可能推出,迈向完全多模态。此外,还提及OpenAI核心团队动态、出走高管新动作及AI发展风险与监管建议。

新智元
算法论文8

ICML 2025 Spotlight | 新理论框架解锁流匹配模型的引导生成

西湖大学冯睿骐、吴泰霖等针对流匹配模型能量引导算法难题,推导新理论框架,提出三大类实用算法,给出性能分析与比较,为流匹配引导采样及生成模型应用提供理论基础。

机器之心
开源动态8

字节推出X-Streamer,实时口型同步与长程记忆数字人框架

字节推出端到端多模态人类世界建模框架X - Streamer,能从单张人像构建可无限流式生成的数字人,实现音素级口型同步和长程记忆。其核心是“思考者–行动者”双Transformer架构,在两张A100 GPU上可实时运行。

带你学AI