多模态开发」共找到 2449 篇相关文章

新闻资讯8

谷歌发布最强 AI“全家桶”、一句话就让AI拍大片!这一夜,谷歌Gemini贯穿始终,网友:果然Android“靠边站”了

谷歌在I/O大会推出AI“全家桶”,含Gemini 2.5模型更新、搜索新AI模式等。谷歌已发布十多个新模型、20多个重大AI产品与功能,多项数据显示AI发展迅速,还有多项目融入产品,多模态模型升级。

AI科技大本营
算法论文7

deepseek-V4算法工程技术深入浅出

文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。

Agent的潜意识
新闻资讯7

吴恩达:AI 将最先杀死前端

AI 对程序员的影响引发热议,吴恩达在 Newsletter 中给出加速排序:前端 > 后端 > 基础设施 > 科研。他认为前端开发被加速最厉害,后端需更多人工引导,基础设施和科研领域 AI 作用有限。同时指出初级、缺乏协作和创造性的工作易被取代。

AGI Hunt
新闻资讯8

100个产品原型同时跑、新模型Mythos断层领先,连skills效果都好到让团队意外:Anthropic内部到底在发生什么?

Claude Cowork 工程负责人 Felix Rieseberg 在播客中透露,未发布的新模型 Mythos Preview 带来“断层式跃迁”,在安全漏洞检测等方面表现出色。Anthropic 内部可同时跑上百个产品原型,执行成本降低。还介绍了 Cowork 开发、应用及产品打造经验。

InfoQ
推荐文章8

端到端语音模型:从语音表征到模型架构

本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。

InfoQ
推荐文章8

拒绝重复造轮子!抽象 80% 工作场景,打造可复用的"AI 助手工厂”

文章指出,为解决重复开发AI助手的效率问题,智空间团队将高频需求抽象为可复用技术方案,打造“AI助手生产线”。介绍四大高频场景本质、共性挑战及对应方案,还阐述分层架构、解决方案、prompt架构等,最终落地“助手工厂”产品。

阿里云开发者
产品应用8

Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间

Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。

AGI Hunt
算法论文8

深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知

多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。

机器之心
产品应用7

AI 编程工具在大型企业“遇冷”?网易 CodeWave 升级研发模式,不只关注“代码生成”

近些年,自然语言编程成 AI 编程产品主流。C 端通用 AI coding 工具表现出色,但国内企业级市场 AI 技术渗透率低。网易 CodeWave 专注企业级场景,指出通用工具痛点,提出‘可控的 AI coding’定位并升级能力,未来还将推新开发模式。

AI前线
7

AI越来越强大,如果客户都去自研了,那企业软件市场会怎么样?

AI能力变强、门槛降低,引发企业软件开发是否会被颠覆的讨论。企业不会自建核心系统,因要专注核心业务且不想承担维护等成本。真正威胁是用AI重新设计产品的同行,技术更替规律下传统SaaS公司需警惕。

AI工程化