多模态代码生成」共找到 4212 篇相关文章

产品应用8

拖拽式搭建分布式Agent工作流!Maze让非技术人员几分钟搞定复杂任务

大模型智能体落地有诸多问题,Maze分布式智能体工作流框架可提供一站式解决方案。它是集成分布式执行引擎的全能平台,有四大核心优势,还有可视化工具让非技术人员也能轻松搭建工作流。

量子位
产品应用7

n8n、扣子太难用了,Vibe Workflow 才是更大众的解

本文介绍 Refly.AI 推出的 Vibe Workflow,该产品获朱啸虎、高瓴投资且开源。它让普通人搭 Workflow,用 Agent 节点替代传统节点,降低门槛,还能迁移其他平台数据,核心是借模型提升发展。

探索AGI
开源动态8

中心动态重分配哈希,北邮团队提出并开源CRH项目 | AAAI 2026

北京邮电大学等机构联合提出新颖端到端框架 CRH,在训练哈希函数时动态更新哈希中心,提升检索精度和语义一致性。论文被 AAAI 2026 收录,代码已开源。

AI前线
新闻资讯7

中国 AI 正处于反超美国的前夜

2025下半年中美AI圈有新现象,一是认可中国AI崛起或反超,如海外企业用通义千问,MiniMax开源模型编程能力强;二是资本豪赌与泡沫风险加剧。中国AI成本低、性能优、ROI高,MiniMax或成中国版OpenAI。

AI科技评论
开源动态8

识别1600+种人类语言,支持少样本扩展到5400+种语言,Meta自动语音识别模型开源

Meta AI发布Omnilingual ASR自动语音识别模型并开源。它能转录超1600种语言,含500多种首次被AI理解记录的语言,还可通过少样本扩展到5400多种,改变了多语言ASR构建范式。

AIGC开放社区
开源动态7

被DeepSeek带火的OCR,最新8个开源模型盘点~

DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。

PaperAgent
开源动态8

可能是目前效果最好的开源生图模型,混元生图3.0来了

腾讯混元发布并开源原生多模态生图模型混元图像3.0,参数规模80B,是参数量最大的开源生图模型,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型。文中介绍其技术方案、测评效果等。

量子位
产品应用7

继微软Playwright之后,谷歌Chrome DevTools MCP也来了(网站开发,AI 自动调试控制台错误)

继微软Playwright后,谷歌推出Chrome DevTools MCP,可让AI代理用上Chrome DevTools,能查DOM/CSS、跑JS等。文中给出多种使用提示词示例,还提供了安装方法链接。

AI进修生
新闻资讯8

2025年深度学习趋势:从Transformer架构到无处不在的边缘计算

2025年深度学习成科技顶流,市场规模飙升。其发展受算力、数据、算法推动,应用于多领域。核心趋势包括Transformer架构发展、低代码开发等,同时也面临伦理、人才短缺等挑战。

AIGC开放社区
开源动态8

苹果端侧AI两连发!模型体积减半、首字延迟降85倍,iPhone离线秒用

苹果在Hugging Face放出FastVLM与MobileCLIP2两条多模态主线。前者主打「快」,首字延迟压到竞品1/85;后者突出「轻」,体积减半。模型和Demo已开放,开发者可集成开发。

新智元