「视觉x代码」共找到 2526 篇相关文章
本文关注vllm V1中管控模型分布式推理的Executor部分,介绍其类型、Executor-Workers架构及数据传输机制,对比V0架构优势,以单机多卡的MultiprocExecutor为例展开讲解,还提及不同数据量的传输方式及相关代码。
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
登上Nature子刊!Meta脑机接口重大阶段性进展,超高实时解码准确率
Meta在非侵入式脑机接口研究取得重大进展,Brain2Qwerty v2能从原始脑信号实时解码句子,平均词准确率达61%,最优78%。研究团队开源训练代码,数据集也同步开放,但应用于临床仍面临精度和设备限制。
突发|Andrej Karpathy官宣加入Anthropic!
周二晚间,Andrej Karpathy在X上自宣加入Anthropic,将在核心预训练团队工作。他是AI领域极具影响力人物,曾任职OpenAI、特斯拉等。此次加入或助推Anthropic上市,也让OpenAI面临压力,或引发新一轮AI军备竞赛。
阿里开源PromptEcho:用冻结多模态大模型为文生图训练提供高质量Reward
阿里团队提出PromptEcho方法,无需标注和训练reward模型,仅通过冻结多模态大模型(VLM)的一次前向推理获高质量reward。实验显示其在文生图和电商海报文字渲染任务效果佳,且已开源相关代码等。
谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜
在大模型竞争白热化背景下,谷歌为解决开发者难题推出 Agent Skills。官方仓库含多项技能,涵盖谷歌云核心服务及架构支柱技能,还提供常见任务流程指南,兼容多平台,能省开发代码。此前还有 Addy Osmani 开源的技能库。
实测刘翔pick的AI汽车,BBA老车主的豪华滤镜碎了
作者试驾了刘翔代言的智己汽车LS8,体验其智能辅助驾驶、AI助理等功能。该车与宝马X5等尺寸相近但价格低,有诸多黑科技,还让BBA老车主滤镜破碎,显示传统豪华溢价时代或终结。
接入 MiniMax M2.7 后,我的 OpenClaw「超进化」了
作者实测 MiniMax 新模型 M2.7,其在基准测试、代码能力、多智能体协作等方面表现出色。接入 OpenClaw 后,能高效完成复杂任务。M2.7 指令遵循率高、长上下文处理能力强且价格低,有望提升 Agent 生态表现。
CVPR 2026 | 1B模型也能当多镜头导演?大连理工&快手可灵开源力作MultiShotMaster
大连理工与快手可灵团队推出MultiShotMaster框架,能在1B左右小参数量级模型实现导演级镜头调度和连贯叙事,支持多图参考、主体运动控制。论文录用至CVPR 2026,代码已开源,还获AAAI CVM Workshop竞赛冠军。
马斯克说今年编程就要死了,你信吗?
近期一条推文称马斯克预言编程今年将消亡,引发热议。但实际是作者二次创作,马斯克只是即兴推测年底或不用写代码。‘AI 直接生成二进制’有跨平台、可审查、可靠性三个问题,编程更可能走向‘AI写、人审’。