「LLM式视觉编码器」共找到 1611 篇相关文章
GPT-5.2 发布:做表格、写 PPT、敲代码 | 打工人的生产力利器
GPT - 5.2发布,在GDPval评测等众多基准测试中刷新行业水平。GPT - 5.2 Thinking适合真实场景与专业工作,在知识型任务、编码、长上下文处理、视觉理解、工具调用等方面表现出色,部分功能需付费使用。
全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案
随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。
Agentic 应用时代,Dify 全链路可观测最佳实践
文章讲述 Dify 平台在 Agentic 应用开发的可观测性挑战,从开发者与运维方视角分析现状、局限与改进方向。云监控推出全景可观测方案,还介绍各组件监控接入步骤及实践指南,最后提及 Qwen - Image 生图优势。
杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切
上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,一上线便引发关注。今日凌晨,杨植麟等人在 Reddit 开展 AMA 活动,回应 K2 Thinking 一系列问题,还回顾了其在多项测试中的亮眼成绩。
HF日趋榜一!真端到端模型AutoDeco终结手动调参解码
大语言模型手动调参解码繁琐,腾讯AI Lab王琰团队联合港中大(深圳)唐晓莹教授团队推出AutoDeco架构,通过创新训练策略让模型动态预测解码参数,在多模型实验中表现出色且已开源。
当搜索遇见 AIGC:京东零售的“千人千面”素材生成实践
在 AIGC 浪潮下,视觉生成技术重构电商生态。京东零售李岩介绍“千人千面”商品素材生成技术链路,包括关键模型及实现框架,还发布焕新版京点点平台并预告新能力,推动电商个性化变革。
Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana
北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。
Browser Use 推出 Code Use:直接用代码控制浏览器
Browser Use 发布 0.9.0 版本,推出专为爬取数据设计的 Code Use。它开发特殊 Agent 和定制 LLM 输出特定代码,通过 CDP 直接操控浏览器,效率和准确性理论上更高,还给出使用示例,同时提醒了安全问题。
Dexmal原力灵机开源Dexbotic,基于PyTorch的一站式VLA代码库
Dexmal原力灵机推出基于PyTorch的开源视觉-语言-动作模型(VLA)代码库Dexbotic,面向具身智能研究者。其架构含三大核心组件,有五大特征,还推出开源硬件,未来将持续投入生态建设。
我是微软工程师,编程了30多年,如今我几乎不再编程了
微软资深工程师 Paul Payne 分享编程 30 多年感受,认为 AI 正颠覆软件工程领域。他所在团队研究 LLM 驱动系统,系统从程序员手中接走大量工作,Amplifier 等工具让编程变得更简单,人类程序员价值将升华。