理解与生成统一」共找到 3129 篇相关文章

产品应用8

阿里通义实验室出品!全新 GUI 智能体 MAI-UI,精准操控你的手机

阿里通义实验室推出 GUI 智能体模型家族 MAI - UI,覆盖多种规模。针对当前 GUI 智能体问题,采用统一方案让模型更强。在多项任务中刷新行业成绩,有性能提升与隐私保护双收益。

带你学AI
开源动态8

170次搜索+50次反思:用GLM-4.7盘点2025 Agent行业趋势,结果太震撼!

作者给智谱新开源的GLM - 4.7布置调研2025年Agent赛道企业的任务,结果令人震撼。该模型进化显著,能整理详细企业信息,还能生成高审美PPT。国内有不少特色AI落地企业。

探索AGI
新闻资讯7

腾讯胡文博:引领 3D 视频世界模型新趋势丨GAIR 2025

2025年12月12 - 13日,第八届GAIR全球人工智能与机器人大会将在深圳举办。腾讯ARC实验室高级研究员胡文博将在13日《世界模型》论坛分享《迈向三维感知的视频世界模型》。他深耕视频生成模型,成果显著。

AI科技评论
新闻资讯8

Karpathy新思考:别把AI当动物,它们是全新的智能物种

Andrej Karpathy发长推提出颠覆性观点,认为人们用错误框架理解AI,对比了动物智能与LLM智能的优化动力、根本差异等,强调优化目标决定智能形态,指出应按其机制对待AI。

AI工程化
新闻资讯7

一夜之间OpenAI神秘模型“o3-alpha”刷爆时间线:远胜 Claude Sonnet

OpenAI神秘新模型“o3-alpha”正在测试,刷爆时间线。早期测试显示其性能超强,能一键生成游戏,前端编码能力远胜Sonnet、o3等。有猜测它是AHC模型或OpenAI将开源的模型。

AI寒武纪
新闻资讯7

这个扩散LLM太快了!没有「请稍后」,实测倍速于Gemini 2.5 Flash

AI初创公司Inception Labs推出首款专为聊天定制的商业级扩散LLM——Mercury。它速度超快、效率高,能实时响应对话。实测显示其速度优于Gemini 2.5 Flash等,不过生成质量有待提升。

机器之心
推荐文章7

小白也能秒懂:趣解GPU各种核心参数规格!

近期美国升级对英伟达H20芯片出口管制,业内震动。文章介绍GPU和显卡区别,讲解GPU关键参数如算力、核心数量等含义,还通过货车、火车类比助小白理解,助读者选合适GPU。

芯师爷
开源动态7

为AI打造的知识图谱服务器MemoryMesh

MemoryMesh是专为AI模型设计的知识图谱服务器,适用于多种结构化数据场景。它有动态模式驱动工具等特性,可自动生成管理工具,还配备记忆查看器,提供安装指南和提示词建议。

GitHubStore
算法论文8

视觉感知RAG × 多模态推理 × 强化学习 = VRAG-RL

数字化时代视觉信息愈发重要,传统RAG方法处理视觉信息面临挑战。阿里巴巴通义实验室的VRAG - RL将强化学习引入多模态智能体训练,革新检索生成范式,提升视觉语言模型多方面能力,代码已开源。

PaperAgent
算法论文8

高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线

现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。

机器之心