「全模态理解模型」共找到 8113 篇相关文章
挑战Claude code和Cursor:阿里Qoder对标全球,AI编程迎来“上下文”革命
AI编程工具爆发式增长,‘上下文’成实用化难题。阿里推出Qoder平台,结合大模型与Agent,可深度检索代码、理解上下文。本文采访Qoder团队工程师,解析其定位、成本、技术路线等关键问题。
北航LiveRepoReflection: 扭转乾坤-仓库级代码反射
本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。
刚刚,Anthropic发现Claude「类意识工作台」!神秘J空间藏着没说出口的想法
Anthropic新研究发现Claude内部存在特殊“J空间”,像静默心理工作区,浮现模型思考概念,不一定在回答里。此研究受关注,还揭示其特性、发现方式及应用,改变对Claude“心智”理解。
这帮清华的,造了一个让龙虾“安全着陆”的新物种
在OpenClaw热潮中,隐私保护缺位成企业和开发者难题。无问芯穹推出InfiniClaw Box,独创‘三段式’架构,适配全模态信源,解决数据安全与模型能力兼顾问题,还与多家企业合作拓展应用边界。
AI「看不懂」、「做不好」视频的问题,混元用「MTSS」解决了
腾讯混元团队提出 Multi-Stream Scene Script(MTSS)新视频描述范式,将传统方式升级为‘多流结构化剧本’。它解决了传统方式语义冗余、扩展性差等问题,在视频理解和生成任务表现显著。
确认!DeepSeek多模态AI已经开测
DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。
AI赛博活佛Andrej Karpathy最新访谈:我学到了他最核心的思维方式
10月17日的Dwarkesh播客访谈里,AI科学家Andrej Karpathy分享思维方式、对AI发展的思考及做AI教育的思路。他用“一阶项”思维抓核心,教学先让学生经历问题,还提出知识可能拖累模型等观点。
Nano Banana Pro或将引爆新安全危机
基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制能力提升。它展现出复杂推理能力,能理解反光、推理指纹,但这或带来隐私危机。
号称视频编辑领域的开源nano banana来了,用文字就能改视频
DecartAI开源Lucy Edit模型,号称视频领域开源Nano Banana,能理解自然语言指令改视频。如输入指令可精准换服装等,渲染快,有身份保持和动态适配亮点,有多个版本,应用场景广。
绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%
JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。