「代码转图片」共找到 1889 篇相关文章
DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro
DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。
替代n8n,用TypeScript写工作流
文章指出n8n、Zapier拖放式工作流调试难、自定义受限,介绍Bubble Lab工具,其用TypeScript实现,代码可自由修改,执行信息透明,还支持导入n8n工作流文件再开发,有一定优势。
OpenAI 内部揭秘:我们如何使用 Codex
文章揭秘 OpenAI 内部使用 Codex 的情况,介绍其在理解代码、重构迁移、性能优化等多方面的应用场景,还给出最佳实践,如用‘提问模式’开始、组织好提示等,展现了 Codex 强大的开发辅助能力。
AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤
文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。
DeepSeek悄悄更新:Mega MoE、FP4 Indexer来了
昨天下午,DeepSeek 更新了 DeepGEMM 代码库,带来新东西 Mega MoE。它将 MoE 计算流程整合,让数据通信和计算同时发生,提高 GPU 利用率。还尝试组合精度、搞 FP4 indexer 等,是基础设施层重构尝试。
清华辍学、斯坦福睡地板,华人小哥用AI社交挑战Meta,融资数千万美元
来自中国的小哥Brandon Chen打造AI原生即时通讯工具Intent,已获数千万美元融资。它结合微信聊天与大模型自动执行功能,如处理图片、规划旅行、生成购物清单等,带来全新聊天体验。
GitHub 1.3k 一款能“填色回忆”的神器:DDColor 让老照片鲜活又逼真
DDColor是阿里达摩院团队提出的新一代图像自动着色模型,基于双重设计,能实现高保真、真实感强的黑白图转彩色图。它兼容多种类型图片,有诸多核心功能,相比传统模型优势明显,应用场景广泛。
ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频
空间音频技术成提升沉浸式体验关键,但现有技术未充分利用360°全景视频空间信息。OmniAudio研究可直接从360°视频生成空间音频,相关代码和数据集已开源,虽有局限但前景好。
机器人长出800个心眼?阿里达摩院开源具身新大脑,硅谷又坐不住了
2026年具身智能竞争激烈,阿里达摩院开源RynnBrain“具身大脑”。它采用分层架构,在16项评测中超越前沿模型。还介绍了核心技术、训练策略等,且全系列模型、评测基准和代码均开源。
Google封神,计算机视觉的GPT3时刻来了!
Google Deepmind称在CV领域做出类似GPT-3的成果,Veo 3经大规模训练涌现通用视觉理解和推理能力,能以图片+提示词完成复杂视觉任务,还具备感知、建模等四大超能力。