「多模态任务」共找到 2698 篇相关文章
长文本生成迎来新突破:拓元智慧推出 DrDiff ,实现效率与质量双提升
拓元智慧联合多团队开发出 DrDiff 框架,解决长文本生成中效率与质量难兼顾问题。其核心是“动态化”,有分层稀疏注意力、动态专家调度、语义锚点状态三个创新组件,经测试表现良好,未来应用值得期待。
告别微调!腾讯提出Training-Free GRPO:无需更新参数,还能保证泛化性,成为传统RL的有力替代
大型语言模型在专业领域表现不佳,传统微调方法成本高、易过拟合。腾讯优图实验室提出Training - Free GRPO,无需更新参数,通过上下文学习提升性能,成本低且泛化性好,是传统强化学习有力替代。
ICLR神秘论文曝光!SAM3用「概念」看世界,重构视觉AI新范式
2023年Meta推出SAM,后SAM 2扩展到视频分割。近日,SAM 3现身ICLR 2026盲审论文,带来「基于概念的分割」新范式,强调按「语义概念」理解和分割图像,还构建数据引擎提升性能。
斯坦福&SambaNova联手发布ACE框架:上下文即战力
文章介绍了斯坦福与SambaNova联手发布的ACE框架。它解决传统提示工程缺陷,将提示工程升级为智能体自我演化体系。通过“生成 - 反思 - 策展”闭环,实现上下文低成本、低延迟、高扩展演化,小模型搭配它能击败大模型+传统提示。
永别了,人类冠军!AI横扫天文奥赛,GPT-5得分远超金牌选手2.7倍
国际天文与天体物理奥赛(IOAA)中,GPT - 5和Gemini 2.5 Pro完胜人类选手。俄亥俄州立大学团队考察五大顶尖LLM,发现它们大多达金牌水平,但在几何、时空推理等方面有困难。
开源仅一周,鹅厂文生图大模型强势登顶,击败谷歌Nano-Banana
腾讯混元团队开源的原生多模态生图模型混元图像 3.0,开源仅一周就在国际权威评测榜单 LMArena 上超越谷歌 Nano - Banana 等,位列文生图综合和开源榜单第一。实测表现出色,技术上也有诸多创新。
香港中科院发布聆音大模型,400万张图喂出个“AI超声神医”
中国科学院香港创新研究院发布超声大模型“聆音”,用超400万张图像的超声数据集,经自监督学习训练。它在多项诊断任务破纪录,临床效果佳,还将模型等开源,有望推动领域发展。
大模型“精细化”对齐,真实性提升25.8%刷新SOTA!token级精准编辑,无需训练即插即用
北航团队在EMNLP 2025提出Token - Aware Editing (TAE)方法,从token层面解决传统表征编辑技术问题,无需训练、即插即用,在多个对齐维度显著提升,如在TruthfulQA任务上真实性指标提升25.8%。
Claude Chrome 插件使用体验:强大,但有点慢
作者分享Claude for Chrome插件使用体验,介绍使用流程,测试让其查看马斯克推文,结果准确。该插件能力强且通用,但存在慢、焦点抢占问题,还提到与deepresearch及云厂商设备的差异。
“分身术”来了!MANA创作者扶持计划带你走进MUMA Island的未来分身实验
文章介绍数字时代“分身术”,它是身份与叙事实验。从概念源流到技术支撑展开阐述,MUMA Island打造“三式分身”创作矩阵,MANA创作者扶持计划重视该项目,有前沿性、可复制性和社会价值,还公布活动信息。