多模态支持」共找到 1364 篇相关文章

开源动态8

能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent

LlamaFactory作者郑耀威团队开源的PenguinHarness,是全球首个多Agent自进化的Harness,能自动构建、评测和改进Agent。它成本低、速度快,适配众多模型,还有严格契约保障安全。已在生产场景应用,效果显著。

机器之心
开源动态7

Vercel 开源 Open Agents,后台运行 AI 编码工作流

Vercel 开源 Open Agents,创建和运行后台编码智能体,提供全栈解决方案。它采用三层架构,核心是智能体与沙箱解耦,多步执行等功能,定位为参考实现,引发不同反响。

InfoQ
开源动态7

画个图就能管理知识?这个开源工具把笔记和画板合二为一了

作者发现开源工具Revezone,它将白板和笔记合二为一,解决图文割裂问题。有Excalidraw、Tldraw白板及类Notion笔记功能,还拖拽分屏。提供线上和桌面版,适合多类人群,优势明显且免费。

小华同学ai
开源动态7

AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android

Mobile MCP 是开源 MCP Server,让 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。

AI Reading Hub
算法论文7

港中文 MMlab×美团新研究:仅用一个模型,应对多种视觉推理任务

港中文 MMLab 与美团联合提出 OneThinker 多模态统一推理模型,将多种视觉任务抽象为‘先推理、后作答’形式,通过多任务强化学习优化。实验显示其在多任务表现佳,为通用视觉推理模型提供参考。

AI科技评论
产品应用8

刚刚,AI视频的天花板被掀翻!测完SkyReels后飘了:我亦有成为专业导演的潜质

昆仑万维官宣上线全新一站式多模态AI视频创作平台SkyReels,同步发布模型SkyReels V3并优化多能力。实测其画布、Agent等功能玩法多,还打通多模态边界,将巩固昆仑万维地位,加速人人专业创作愿景到来。

机器之心
产品应用8

AI不再「炫技」,淘宝要让技术解决用户每一个具体问题

技术发展迅速,淘宝力求将AI融入应用场景解决用户问题。今年3月升级AIGX技术体系,近日郑波公开淘宝全模态大模型进展,认为狭义AGI或5 - 10年到来,多模态智能成关键技术域。

机器之心
算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元
推荐文章7

GPU为什么能取代CPU,成为计算领域无可争议的核心?

过去CPU是计算核心,如今GPU凭借并行处理能力崛起。在人工智能、大数据等领域,GPU优势明显,软件也推动其普及。未来,GPU将在更多领域发挥作用,还会与CPU融合。

芯师爷
开源动态7

Oxlint 1.0 稳定版发布:基于 Rust 的 JavaScript 静态检查器

Oxlint是基于Rust的JavaScript和TypeScript静态检查器,其1.0稳定版发布。它有快速检测、规则覆盖广等特点,性能比ESLint高50 - 100倍,能处理多文件规则,开发者反馈积极。

InfoQ