「快看2.0」共找到 3522 篇相关文章
AI 基础知识从 0.5 到 0.6—— Transformer 架构为何能统治AI领域?
文章围绕Transformer架构展开,先介绍其诞生背景,对比CNN、RNN等模型,阐述其在多领域的核心地位。接着剖析工作流程、实现原理,包括QKV机制、多头注意力等。最后列举T5、GPT等常见架构模型,并提及通义千问3与MCP协议。
Prompt三则(2)
文章给出三则Prompt。一是找行业‘老司机’俯瞰行业,设定前辈身份,强调实用指引;二是穿透语言看‘内核特质’,如剥洋葱般挖掘;三是将一句话‘画面化’,让抽象概念成感官盛宴。
1B参数,0.21秒识别,0.3%错字率:混元OCR拿下7项SOTA
腾讯开源模型 HunyuanOCR 在权威榜单 OmniDocBench 上霸榜,虽仅 1B 参数,却在 7 项任务击败众多大模型。它解决传统 OCR 流水线及通用大模型痛点,通过独特架构和训练方法实现高效准确识别。
AI 时代的新可观测性:不只看系统崩没崩,还要看模型有没有胡说
New Relic首席技术战略官Nic Benders与主持人探讨可观测性从传统到AI驱动的演进,提及LLM与统计方法协同处理海量数据,还讨论了监控AI系统的难题及可观测性核心是理解业务目标。
2.2K Star!一个开源 AI 桌面客户端,搞定所有 AI 工具的安装、配置与管理!
超60%用户首次尝试AI Agent工具时卡在安装配置阶段。EchoBird是开源AI桌面管理工具,能集中解决AI Agent使用痛点,如一键安装、统一配置等,采用Tauri + Rust架构,有四大应用场景。
7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”
上海创智学院LeapQuest团队联合多校,在ICML 2026接收两篇论文,提出“Think with Images/Think with Videos”范式,让视觉证据参与模型推理,Ophiuchus和MedScope分别用于图像和视频诊断,表现出色。
2.2K标星!一个库打包37个翻译平台,开发者再也不用为翻译API头疼了!
在项目开发中,翻译需求常让开发者为适配各平台 API 头疼。近期 GitHub 上的开源 Python 库 Translators 是省心之选,它集成 37 个主流翻译平台,统一接口,免 API 密钥,支持 450+ 语言互译。
AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤
文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。
东方理工团队提出HiDrop:重构MLLM计算路径,压缩90%视觉Token实现2.2倍加速
东方理工大学沈晓宇团队提出HiDrop,基于MLLM不同层功能差异,设计出延迟注入、凹金字塔式剪枝和提前退出的视觉Token压缩策略。实验显示,它能压缩约90%视觉Token,保持98.3%性能,实现训练和预填充加速。
刚刚,这家0产品0模型就估值854亿的公司,终于发布了首款产品!
Thinking Machines Lab推出首款产品「Tinker」,这是专为语言模型微调而生的API,让开发者摆脱底层架构束缚,用简单Python代码专注创新。它功能强大,目前免费私测,已获普林斯顿、斯坦福等团队使用。