指令集架构」共找到 2555 篇相关文章

算法论文8

拒绝「盲修」:JarvisEvo 如何让 Agent 像人类一样拥有「视觉反思」能力?

现有 Image Editing Agent 缺乏视觉反馈,易致「指令幻觉」和 Reward Hacking。JarvisEvo 应运而生,它通过 iMCoT、SEPO、On - Policy Reflection 等技术,结合 ArtEdit 数据和三阶段训练,在修图上表现出色,意义超图像编辑。

机器之心
开源动态8

Agent记忆赛道大洗牌!LoCoMo-Refined重磅发布,主流记忆框架迎来核心检验

南京大学与上海人工智能实验室联合推出 LoCoMo-Refined,这是严苛的 Agent 记忆评测基准。它指出当前记忆评测基准有两大漏洞,在其标准下主流记忆框架得分普降,且相关数据和评测脚本已开源。

AI科技评论
算法论文7

近期,不错的LLM Agent统一记忆框架综述~

随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据复现比较10个方法,还设计出新的低token开销框架。

PaperAgent
新闻资讯7

米哈游蔡浩宇AI公司首个视频模型曝光了

米哈游蔡浩宇的AI公司Anuttacon首个视频模型LPM 1.0曝光。它可通过多模态形式生成动态角色,有超绝情绪演绎、实时视频生成等能力,背后技术架构复杂,目前未正式上线。

量子位
算法论文7

BLIP3-o统一图像生成与理解,多模态融合趋势显现

BLIP3 - o致力于统一图像理解和生成,提升生成质量与效率。它融合自回归和扩散模型,采用CLIP + Flow Matching架构等。经训练,在图像理解和生成任务表现佳,指令微调效果显著。

CourseAI
新闻资讯8

当机器人学会「看」和「说」之后,如何让它们真正拥有「手感」?

今年四月,戴盟机器人联合多家机构发布含触觉全模态具身数据 Daimon-Infinity 并开源 10000 小时数据。IEEE 与戴盟联合创始人王煜教授深度对话,探讨触觉感知对机器人技术格局的影响、具身机器人落地场景等问题。

AI科技评论
开源动态8

字节跳动开源文档解析大模型Dolphin,告别繁琐的文档处理,上线狂揽1k星,真是绝了!

字节跳动开源文档解析大模型Dolphin,采用两阶段分析 - 解析范式,有异构锚点提示等功能,适用多领域。技术架构基于视觉 - 编码器 - 解码器,训练超3000万个样本,安装推理简单,比同类更具竞争力。

小华同学ai
算法论文7

BLIP3-o统一图像生成与理解,多模态融合趋势显现

BLIP3 - o致力于统一图像理解和生成、提升生成质量和效率。它融合自回归与扩散模型,采用CLIP + Flow Matching架构等技术亮点。经训练,在图像理解和生成任务表现出色,指令微调效果显著。

CourseAI
开源动态8

我们对 Coding Agent 的评测,可能搞错了方向

用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测,结果显示模型过程规范遵循不足,未来训练需引入过程监督。

Founder Park
算法论文8

登上NeurIPS,Genesis开创无需OCC引导的多模态生成新范式,在视频与激光雷达指标上达到SOTA水平

华中科技大学与小米汽车提出多模态图像 - 点云联合生成框架Genesis,采用两阶段架构和DataCrafter模块。在nuScenes数据实验显示,其在视频与激光雷达指标达SOTA水平,还提升了下游感知任务效果。

机器之心