混合位置编码」共找到 653 篇相关文章

开源动态8

夯,开源 LiteParse,没有对手的 PDF 解析工具,知道的太晚了!

LlamaIndex团队开源独立工具LiteParse,用Rust打造,可本地运行、零成本、高精度解析PDF。它能提取文本及精确位置,有多种输出格式,支持多格式输入,还介绍了安装、使用、OCR配置等内容及应用场景。

小华同学ai
产品应用8

Codex 大更新:一个 AI,接管你所有软件。

Codex 迎大更新,有望成 OpenAI 超级应用核心。它能与多工具协作,超 300 万开发者在用,近半使用场景非写代码。具备跨应用多 Agent、非编码任务处理等功能,还增添图像生成等特性。

AI进修生
产品应用8

从Vibe Coding到Agentic Engineering:重构后台开发全流程

文章介绍从 Vibe Coding 到 Agentic Engineering 的转变,以真实需求为例,展示后台开发全流程,涵盖需求获取到合入发布各阶段,介绍各阶段工具及操作,凸显 Agentic Engineering 优势,强调人编排、AI 执行的核心理念。

腾讯技术工程
新闻资讯7

The Batch: 920 | Nano Banana 2 在性能/价格比方面实现提升

Google发布Nano Banana 2(正式名称Gemini 3.1 Flash Image),是图像生成系统。它速度快约4倍、成本减半,支持多功能,在多个排行榜中位列前三,以低价接近文字 - 图片排行榜领先位置

DeeplearningAI
开源动态8

Transformer创新架构SALA:上下文更长,推理更快

面壁智能发布行业首个大规模训练的稀疏 - 线性注意力混合架构 SALA 及文本模型 MiniCPM - SALA。该架构降低推理开销与显存占用,MiniCPM - SALA 在长文本处理及推理上表现出色,还发起大奖赛探索性能极限。

PaperAgent
推荐文章8

技术框架不重要,大厂简历不值钱?小哥不会写代码却进了Lovable,80% 靠聊天也能上生产

零技术背景的Lazar Jovanovic成Lovable全职Vibe Coder。他80%时间规划对话,20%执行,多开版本让AI“内卷”。他认为无技术背景反是优势,使用AI要有“妄想”心态,编码已非核心,判断力和品味更重要。

AI前线
开源动态8

智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析

智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。

AIGC开放社区
产品应用8

OpenAI Codex桌面版深夜突袭!一人指挥Agent军团,程序员彻底告别996

OpenAI推出编码杀器Codex桌面App,可指挥多Agent并行协作。它能多任务并行切换,创建调用Skills,设置自动化流程,从写代码进化到解决问题,还具备双人格模式,默认安全,有望重塑开发者与代码交互逻辑。

新智元
开源动态8

租了8张H100,他成功复现了DeepSeek的mHC,结果比官方报告更炸裂

元旦期间,DeepSeek发布的mHC震撼AI社区。FlowMode工程师Taylor Kolasinski租8张H100复现mHC,结果比官方报告更优。文章介绍复现实验,对比mHC、HC和标准残差结构,揭示超连接在规模化时的不稳定性及mHC的解决办法。

机器之心
算法论文8

全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案

随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。

机器之心