图像思考」共找到 1067 篇相关文章

开源动态7

当「提示词工程师」开始像制片人一样思考,Seedance 2.0 Skill OS 深度解析!

AI 视频工具圈存在模型强但使用方式单一、信息孤岛和提示词‘玄学化’问题。`seedance - 2.0` 仓库搭建‘操作系统’,将‘提示词’升级为可审计制作流程,还给出各岗位产出表和使用方式。

开源星探
产品应用8

阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合

阿里Qwen - Image - 2.0将生图与编辑能力合二为一。它支持长指令,能精准渲染大量文字,引入物理逻辑让文字呈现真实质感,在生图和编辑上对语义理解和画面重构能力强。

AIGC开放社区
算法论文8

重新思考RLVR中的熵正则:从探索不足到探索过度的破局之路

2024年以来,RLVR使大模型在推理任务有显著突破,但实践中探索机制易失衡。传统熵正则化在LRM场景易走向极端,研究团队提出SIREN方法精准调控探索,实验显示其在多模型和数据集上性能提升显著。

深度学习自然语言处理
开源动态8

更高智商更快思考!蚂蚁开源最新万亿语言模型,多项复杂推理SOTA

蚂蚁正式发布拥有万亿参数的通用语言模型Ling-1T,超越多个开源和闭源模型,在多项复杂推理基准中取得SOTA表现。它推理和代码能力强,研发采用‘中训练+后训练’,还提出新奖励机制和LPO方法。

量子位
开源动态8

不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目

MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。

小华同学ai
算法论文8

大模型到底是怎么「思考」的?第一篇系统性综述SAE的文章来了

在大语言模型时代,人们需要“能解释”的LLM。SAE技术崛起,作者团队发布首篇SAE综述,梳理其技术、演化和挑战。介绍了SAE概念、优势,涵盖其技术框架、可解释性分析等多方面内容。

机器之心
算法论文8

从打分器到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心
算法论文8

黎曼猜想推至理论边界99.55%!元代理架构AI:在思考中重塑大脑

科学家面临让AI解决复杂科学难题的问题,传统固定架构AI处理特定复杂问题不顺手。近日学术团队提出Eureka架构,能让AI动态“生长”专用“大脑”,在测试中表现出色,还在数学和物理领域有重大成果。

新智元
算法论文8

DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!

4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。

花叔
开源动态8

打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner

人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。

机器之心