「视觉编程」共找到 1708 篇相关文章
突破视觉仿真算力瓶颈!新一代具身智能仿真框架开源:高吞吐并行高保真渲染助力规模化训练
具身人工智能向以视觉为中心转型,但面临“看得真”和“训得快”难题。清华大学智能产业研究院等提出GS - Playground通用多模态仿真框架,融合高吞吐量并行物理仿真与高保真视觉渲染,成果被RSS 2026录用,将开源。
24B模型编程超DeepSeek全家桶,32G内存苹果电脑就能跑,专门针对真实GitHub Issue训练
Mistral发布最新开源编程模型Devstral,参数24B,能在单卡RTX4090甚至32G内存Mac上运行。它专为编程智能体推出,针对真实GitHub Issue训练,在SWE - Bench Verified测试中表现出色,还可与All Hands AI框架配合。
GPT-5.4 发布,OpenClaw 要被替代?OpenAI 新模型会自己用电脑了,还顺手把编程能力拉满
今天,OpenAI 发布 GPT-5.4,将推理、编程和计算机使用能力整合,具备原生电脑操作能力,提升了工具使用效率。它成本降低、幻觉减少、编程能力更强,但 API 价格较高。其或与 OpenClaw 抢夺入口。
北大团队让AI学会考古!全球首个古希腊陶罐3D视觉问答数据集发布,还配了专用模型
北大团队推出全球首个面向古希腊陶罐的3D视觉问答数据集VaseVQA - 3D,配套专用视觉语言模型VaseVLM。传统模型面对文化遗产复杂对象有不足,新数据集和模型让AI迈向‘文化考古Agent’,未来将拓展到更多领域。
刚刚,GPT-5.4 发布,百万上下文、最强全能模型
OpenAI发布GPT - 5.4,集推理、编程等能力于一体,支持百万级上下文窗口。有三个版本,功能全面升级,如支持中途打断、电脑操作、视觉能力提升等,还更省token、少幻觉,安全机制完善,价格有调整。
杨植麟亲自发布,月之暗面最强模型Kimi K2.5开源
杨植麟发布月之暗面最强模型Kimi K2.5,经约15万亿视觉与文本混合数据预训练,有顶尖编程与视觉能力及智能体蜂群范式。在多基准测试表现优,成本低于对手,还能提升办公生产力。
ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式
本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。
通义灵码编程智能体,上线!
近期 Qwen3 正式发布并开源 8 款「混合推理模型」,表现出色。通义灵码全面支持 Qwen3 并上线编程智能体,具备多种能力,支持配置 MCP 工具,集成魔搭 MCP 广场,能大幅提升开发效率。
AI编程的下半场来了?学会用Agent Skill解决编程的痛点问题
文章分享用 Agent Skill 解决 AI Coding 痛点的实操复盘,如让代码上线、解决 AI 不用 Skill 问题。介绍 Skills 原理、CloudBase Skills 优势及与 MCP 组合,还给出实战案例、踩坑经验和未来规划。
EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式
当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。