「动态自感知能力」共找到 3758 篇相关文章
多模态大语言模型的核心技术架构与训练方法的进化
文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。
字节阿里DeepSeek决战春节:一场关乎14亿人的重磅AI大战
春节将至,字节、阿里和DeepSeek间的AI大战拉开帷幕。字节将推三款多模态旗舰模型;阿里或发布Qwen 3.5,让千问打通支付与电商;DeepSeek V4或携强代码能力突袭。这是对用户生活入口和互联网秩序的争夺。
为什么AI总是"记错"你?我们造了一个"合成人生"来测试
现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。
西湖大学修宇亮:数字人重建,慢慢都会变成基础模型的微调任务 | GAIR 2025
12月13日,西湖大学修宇亮在GAIR 2025分享数字人重建进展。其团队成果UP2You将建模时间从4小时缩至1.5分钟;ETCH获更准确内部人体结构;Human3R可实时动态重建人物场景。他认为未来数字人重建将成基础模型微调任务。
社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。
Karpathy、Claude Code之父Boris,最新访谈,把整个程序员圈炸了!
假期红衫AI Ascent 2026上,Claude Code之父Boris与Karpathy演讲引发关注。Boris称编程执行层已解决,他用Claude App工作,全公司代码由模型生成;Karpathy提出Software 3.0概念,还谈到模型能力不均匀。两人还对面试、创业等给出看法。
慕了!内存芯片巨头年终奖人均64万;32岁程序员猝死背后公司被扒,曾给39万“封口费”;马斯克曝星舰成本将降99%,商业航天受捧|AI周报
这是一篇AI周报,涵盖多领域热点。如SK海力士发高额年终奖;月之暗面张予彤称Kimi用少量资源开发领先模型;马斯克透露星舰目标、人形机器人计划等;多家公司有新动态,如阿里推AIGC应用、百川发布医疗大模型等。
小美Agent:当龙猫遇到美团外卖的灾难现场
作者体验美团AI助手“小美”后吐槽不断。美团称其用有5600亿参数的龙猫大模型,能力接近GPT - 4o,但它理解需求差、操作订单无效、定位混乱。美团做AI是为跟风,未解决用户真需求,是资源浪费。
腾讯出手了!彻底入局Agent
腾讯云入局智能体赛道,将大模型知识引擎升级为智能体开发平台。该平台亮点多,如可一键发布到企业微信,具备多工具调用、多Agent协作能力,工作流有全局视野Agent节点,还有Excel检索增强功能,经测试表现出色。
无需验证器的RL:RLPR解锁LLM通用推理潜能
现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。