多模态输出」共找到 1196 篇相关文章

算法论文8

「Thinking with Images」推理速度太慢?「Zooming without Zooming」 让AI不调用工具也能「明察秋毫」!

上海交通大学与蚂蚁集团联合团队发布多模态大模型成果“Zooming without Zooming”。该研究提出R2I方法,将“缩放”转为训练目标,使模型单次前向传播实现细粒度感知,团队开源的ZwZ模型家族达开源SOTA性能。

AI科技评论
推荐文章7

深度解析世界模型:新范式的路线之争,实时交互与物理仿真

文章认为2026年多模态技术将有大发展,世界模型轮廓渐清。文中对比语言、视频生成模型,指出世界模型优势,分析实时视频与3D结构化两条路线,介绍不同公司产品并以四象限框架分类。

海外独角兽
产品应用8

创业一年后,李飞飞推出首款可商用世界模型 Marble,任意模态都可生成 3D 世界

李飞飞创业公司 World Labs 推出可商用世界模型 Marble,支持多模态输入,生成的 3D 世界更丰富细致。李飞飞认为空间智能是 AI 下一个前沿,当前 AI 在这方面能力不足,而 Marble 正推动其发展。

Founder Park
开源动态8

WAIC 2025大黑马,一个「谢耳朵AI」如何用分子式超越Grok-4

当Grok - 4讲冷笑话时,中国科学家用书生Intern - S1破解癌症药物靶点密码。7月26日上海AI实验室发布并开源Intern - S1,多模态能力全球开源第一,相关平台也上线,有望重构科研生产力。

机器之心
算法论文7

Gemini 2.5 Pro 是怎么炼成的?-- gemini 2.5 技术报告阅读笔记与思考

文章是 Gemini 2.5 技术报告阅读笔记。介绍其成功点有多模态、LongContext、思考能力;还阐述模型结构、训练和数据情况,以及代码、事实性、长上下文等特定能力的提升,最后提到基于其构建的智能体。

chaofa用代码打点酱油
开源动态8

只训练数学,却在物理化学生物战胜o1!新强化学习算法带来显著性能提升,还缓解训练崩溃问题

上海创智学院、上海AI Lab的MM - Eureka系列工作提出新强化学习算法CPGD,缓解训练崩溃问题,提升性能。还构建多模态强化学习框架,推出MMK12数据集和MM - PRM模型,开源相关成果。

量子位
Product Application7

PDF难点解析:处理复杂表格、水印、印章、复选框、信息抽取等7项任务,6大能力

文章介绍Nanonets - OCR - s可处理关键信息提取、视觉问答等7项任务,具备LaTeX方程识别、图像描述等6项能力,还给出体验链接。但测试发现英文体验优于中文,模型有重复输出、幻觉严重问题。

CourseAI
产品应用7

Meta发布Muse Spark,MSL的首份答卷!Alexandr Wang通过了吗?

Meta发布Muse Spark,是MSL首个模型,经九个月技术栈重构,效率优先。它有原生多模态推理能力,Contemplating模式处理复杂查询,安全评估突出,产品功能升级,商业化转向明显,正逐步在Meta应用推出。

AI工程化
产品应用8

我们做了比你更懂 Java 的 AI-Agent -- Arthas Agent

Arthas是强大的Java诊断工具,但门槛高。Arthas Agent可将自然语言意图转化为Arthas操作,输出诊断报告。它技能优先、安全优先、循证闭环,通过多案例展示其诊断优势,还介绍使用方法和提效建议。

阿里云开发者
算法论文7

从BERT到T5再到Qwen3:关于Embedding的八点总结

哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。

PaperAgent