「多模态思维链」共找到 1405 篇相关文章
4000 Star,Vibe Coding终级指南:胶水编程
Vibe Coding由karpathy提出,本文分享其终极指南。介绍了胶水编程、方法论精要、工具资源、编码模型性能分级参考等内容,还给出架构与工作流程,建议选第一梯队模型处理复杂任务。
你急它不急:GPT-5先判断,再决定「速答」还是「深想」
OpenAI副总裁Jerry Tworek透露,GPT - 5能判断问题难度,分配思考时间,决定何时停下。它升级了推理能力,有了时间感,采用受控思考机制,提升了复杂任务准确率,减少幻觉。其进化历经o1、o3到GPT - 5阶段。
程序员不再写代码,而是靠「感觉」!年度热词Vibe Coding背后的编程革命
‘vibe coding’被《柯林斯词典》评为2025年度词汇,它指用自然语言提示让AI协助编写代码。从键盘到语气,从逻辑到氛围,AI改写编程,也改变人类语言与思维,理性与感性开始融合。
美团开源全模态,比肩顶级闭源模型,开源新SOTA
美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在多基准测试表现出色。
AEPO:智能体熵平衡策略优化,让探索更稳,推理更深!
中国人民大学与快手团队联合提出 AEPO 算法,解决熵驱动式智能体强化学习训练不稳等问题。它设计两项核心机制,在 14 个基准上优于主流算法,在 X 等平台获高关注。
超越谷歌Banana,字节联合香港中文大学等高校开源最强图像编辑生成系统DreamOmni2
香港多高校与字节跳动联合研发的DreamOmni2系统,实现图像编辑与生成领域SOTA。它用三步造出高质量数据,提出索引编码等方案,联合训练模型,实际效果超越部分商业模型,为AI创作带来新可能。
永别了,人类冠军!AI横扫天文奥赛,GPT-5得分远超金牌选手2.7倍
国际天文与天体物理奥赛(IOAA)中,GPT - 5和Gemini 2.5 Pro完胜人类选手。俄亥俄州立大学团队考察五大顶尖LLM,发现它们大多达金牌水平,但在几何、时空推理等方面有困难。
开源仅一周,鹅厂文生图大模型强势登顶,击败谷歌Nano-Banana
腾讯混元团队开源的原生多模态生图模型混元图像 3.0,开源仅一周就在国际权威评测榜单 LMArena 上超越谷歌 Nano - Banana 等,位列文生图综合和开源榜单第一。实测表现出色,技术上也有诸多创新。
“分身术”来了!MANA创作者扶持计划带你走进MUMA Island的未来分身实验
文章介绍数字时代“分身术”,它是身份与叙事实验。从概念源流到技术支撑展开阐述,MUMA Island打造“三式分身”创作矩阵,MANA创作者扶持计划重视该项目,有前沿性、可复制性和社会价值,还公布活动信息。
大模型如何推理?斯坦福CS25重要一课,DeepMind首席科学家主讲
Google DeepMind首席科学家Denny Zhou在斯坦福CS25课程分享大语言模型推理见解,总结了四个关键点,阐述推理机制、优化方法及最新进展,还介绍多种推理方法并比较其优劣。