多语言视觉问答」共找到 1663 篇相关文章

产品应用8

Eino ADK:一文搞定 AI Agent 核心设计模式,从 0 到 1 搭建智能体系统

语言模型发展下,Agent成AI落地主流,但传统开发有痛点。Eino ADK为Go开发者提供智能体开发框架,解决核心难题,还介绍了Agent功能、ADK模式、构建方法及多Agent协作场景等。

InfoQ
推荐文章7

当代码遇上大模型:智能编程助手的架构设计与工程实践

在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动段潇涵介绍如何基于大语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。

InfoQ
产品应用8

揭秘!腾讯如何训练多智能体像专家一样设计游戏场景

腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用图像引导生成3D场景。它构建多智能体工作流,结合高质量数据集,经模型微调、视觉解析等步骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。

腾讯技术工程
算法论文8

大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制

大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。

深度学习自然语言处理
新闻资讯7

马斯克官宣1万亿瓦芯片计划,红杉合伙人力挺:xAI会赢!

马斯克宣布自建晶圆厂“Terafab”,目标每年1太瓦算力,还要把数据中心送上天,引发争议。红杉合伙人Shaun Maguire力挺xAI,认为其会赢,还指出马斯克有识别技术拐点的能力,虽错过语言模型转向,但已修正。

新智元
算法论文8

多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开

上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。

量子位
产品应用7

Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了

由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。

机器之心
算法论文8

PixelRefer :让AI从“看大图”走向“看懂每个对象”

多模态大模型多停留在整体场景级理解,现实任务需细粒度、对象级理解。浙江大学等联合提出PixelRefer框架,可实现精细视觉指代与推理,在多项任务表现领先,轻量版性能优,还开源两类数据集。

机器之心
新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化
开源动态8

AgentScope 正式发布 Skills 支持 - 实现渐进式披露

文章指出大语言模型驱动的Agent系统存在核心矛盾,常见上下文加载方案有局限,缺乏灵活机制。介绍了AgentScope发布的Skill机制及渐进式披露策略,还讲了其在Java中的实现,最后分析了适用与不适用场景。

阿里云开发者