多模态视觉语言模型」共找到 2255 篇相关文章

产品应用7

Thinking Machines 发布 Tinker,重新定义 LLM 微调的边界

Thinking Machines 发布工具 Tinker,它是灵活的语言模型微调 API,采用‘责任分工’模式,让研究者专注算法创新,不用被运维细节拖累。此模式获 Karpathy 赞赏,目前 Tinker 开始内测,理念受欢迎。

AI工程化
开源动态8

全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品

蚂蚁通用人工智能中心自然语言组联合香港大学自然语言组推出PromptCoT 2.0,押注任务合成。它让30B - A3B模型在数学代码推理任务达SOTA,全面升级效果、数据和方法,还将考虑多方向发展。

量子位
算法论文8

RLHF与RLVR全都要,陈丹琦团队最新力作将推理能力拓展到通用智能

普林斯顿大学陈丹琦团队发布学术成果,提出基于模型奖励思维的强化学习(RLMT)方法,弥合专门推理与通用对话能力差距,将链式思维优势扩展到更广泛范围,提升整体对话表现。

机器之心
新闻资讯7

Nano Banana核心团队:图像生成质量几乎到顶了,下一步是让模型读懂用户的intention

这是对Nano Banana核心团队的专访。团队认为图像生成质量提升空间有限,未来关键在模型可表达性和读懂用户意图。还探讨了图像模型发展趋势、应用场景、产品设计、评估方式等,提及与传统工具将长期共存。

Founder Park
算法论文8

GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”

多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。

深度学习自然语言处理
新闻资讯8

谷歌AI新里程碑:一个能「做研究」的系统诞生了,用LLM+树搜索编写专家级软件

谷歌提出能帮科研人员编写「专家级」科研软件的AI系统,融合大语言模型和树搜索,可整合重组知识构建新思路。在多领域超人类表现,但局限于可量化任务。

机器之心
新闻资讯7

人类秒懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”

来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。

量子位
产品应用8

用“蒸汽机”生成视频,还能音视频一体化交付?

8月21日百度营销发布百度蒸汽机2.0,含多版本,有声版可音视频一体化交付。经测试,其生成视频细节佳、运动规律合理。它能解决影视业诸多痛点,成本低,还可免费使用。

AI产品黄叔
算法论文8

演讲生成黑科技,PresentAgent从文本到演讲视频

联合团队提出 PresentAgent,能将长篇文档转化为带解说演示视频。采用模块化流程,还引入 PresentEval 评估框架。实验显示其接近人类表现,优于现有方案,展现了多模态智能体潜力。

机器之心
产品应用8

AI视频界变天!Decart发布实时“Sora”,直播/游戏业或遭降维打击

Decart创业公司推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创LSD技术。其响应低于40毫秒,靠历史增强等技术攻克难题。它不止用于特效,平台将持续升级,创始人目标是打造‘千亿级独角兽’。

AI工程化