「多模态大型语言模型」共找到 1987 篇相关文章
当前关于 Vibe Engineering 的所有认知都会在 1 个月内严重过时
作者分享 Vibe Engineering 实践体会,指出当前认知很快过时,因 AI 编程工具和模型进步大。还对比了 Opus 4.5、GPT - 5.2 等模型,阐述人在开发各阶段角色,介绍多 Agent 协同实践及未来软件公司组织形态变化。
LLM时代的事件抽取:从静态任务到认知脚手架
此综述论文探讨LLM时代事件抽取价值,认为其未被削弱,应视为“认知脚手架”。它系统梳理任务分类、方法演进等,还提出六大未来研究方向,指向将其演化为智能感知与记忆层。
李飞飞万字长文爆了!定义AI下一个十年
李飞飞新文指出AI下一个前沿是「空间智能」,揭秘其「世界模型」核心框架和三大核心支柱。构建具备空间智能的AI需世界模型,其应用涵盖创意、机器人、科学医疗等领域,有望提升人类生活。
承认自己开源不行?转型“美国DeepSeek”后,两个谷歌研究员的AI初创公司融到20亿美元,估值暴涨15倍!
AI创业公司Reflection AI由两位前Google DeepMind研究员创立,仅一年就完成20亿美元融资,估值达80亿美元。它从编程领域起步,推出代码理解智能体Asimov,现转型为开源替代公司,要打造开放模型。
刚刚,全球AI生图新王诞生!腾讯混元图像3.0登顶了
LMArena竞技场发布文生图榜单,腾讯混元图像3.0夺冠,超越谷歌、字节和OpenAI等模型。它是原生多模态模型,语义理解强,核心技术独特,经多阶段训练,效果能与顶尖模型媲美。
Agent下半场!比Prompt更重要的是「上下文工程」,Anthropic首次系统阐述
Anthropic发文章阐述上下文工程,指出构建语言模型重点正从提示工程转向上下文工程,探讨了其与提示工程区别、重要性,给出实践指导原则、新趋势及应对长时程任务策略。
Thinking Machines 发布 Tinker,重新定义 LLM 微调的边界
Thinking Machines 发布工具 Tinker,它是灵活的语言模型微调 API,采用‘责任分工’模式,让研究者专注算法创新,不用被运维细节拖累。此模式获 Karpathy 赞赏,目前 Tinker 开始内测,理念受欢迎。
全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品
蚂蚁通用人工智能中心自然语言组联合香港大学自然语言组推出PromptCoT 2.0,押注任务合成。它让30B - A3B模型在数学代码推理任务达SOTA,全面升级效果、数据和方法,还将考虑多方向发展。
RLHF与RLVR全都要,陈丹琦团队最新力作将推理能力拓展到通用智能
普林斯顿大学陈丹琦团队发布学术成果,提出基于模型奖励思维的强化学习(RLMT)方法,弥合专门推理与通用对话能力差距,将链式思维优势扩展到更广泛范围,提升整体对话表现。
Nano Banana核心团队:图像生成质量几乎到顶了,下一步是让模型读懂用户的intention
这是对Nano Banana核心团队的专访。团队认为图像生成质量提升空间有限,未来关键在模型可表达性和读懂用户意图。还探讨了图像模型发展趋势、应用场景、产品设计、评估方式等,提及与传统工具将长期共存。