「文本提取」共找到 549 篇相关文章
看完Kimi K2.5技术报告,它的视觉Agentic真给我惊到了
Moonshot AI发布Kimi K2.5技术报告,该模型将文本和视觉打通,有并行执行的智能体集群系统。它采用Joint Training,提出“Zero-Vision SFT”,用MoonViT - 3D处理图像和视频,开源后受欢迎,展示通用智能体可能。
你以为在点「红绿灯」验证身份,其实是在给AI免费打工
验证码发展多年,从最初文本形式到如今图像形式。用户点选验证码时,实际在为AI免费提供训练数据,如谷歌让全球网民免费转录资料、为自动驾驶AI打工。如今验证码攻防战激烈,未来或利用AI弱点创新。
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。
中学生就能看懂:从零开始理解LLM内部原理【十三】|GPT 架构如何工作 ?
本文是对GPT架构工作原理的解读。介绍了GPT与Transformer的关系,阐述其从输入文本到预测下一词概率的流水线,详述训练和推理流程,还提及GPT架构进化的混合专家(MoE)模型。
夯,开源 LiteParse,没有对手的 PDF 解析工具,知道的太晚了!
LlamaIndex团队开源独立工具LiteParse,用Rust打造,可本地运行、零成本、高精度解析PDF。它能提取文本及精确位置,有多种输出格式,支持多格式输入,还介绍了安装、使用、OCR配置等内容及应用场景。
新DeepSeek R1代码能力直逼Claude 4!附生成任何优质网站的通用提示词
作者体验DeepSeek R1超8小时,发现其文本写作问题大幅修复,思维链推理改进,代码能力提升,前端审美直逼Claude 4。文章展示其前端能力,给出写前端网页提示词及设计逻辑,还探讨了其在复杂任务中的表现。
AI办公斩杀线,一页文档多少钱
腾讯混元Hy4 preview正式发布并开源,参数770B,是开源阵营里参数最大的Apache 2.0模型。它能处理长文本,官方定位有软件工程、办公分析等四个方向。还分析了处理一页文档的成本,指出办公AI下半场重在‘读懂’。
大模型最难的AI Infra,用Vibe Coding搞定
Andrej Karpathy 力荐的 Vibe Coding 在 AI Infra 开发中常「水土不服」,存在上下文丢失、决策偏离、质量不稳定等问题。文章提出文本驱动的 Vibe Coding 方法,并以 Agentic RL 中的资源调度系统为例验证其有效性,还介绍了相关团队和工具。
分享2个模型省钱大法
文章分享两个大模型API省钱技巧。一是文本转截图,适用于输入长输出短、费用花在输入token的任务;二是音频加速识别,OpenAI语音识别模型Whisper按音频时长收费,加速音频可省钱,还可包装成API服务盈利。
可灵2.5 Turbo太凶残:30%成本暴降+效果飞跃,生成体操动作可去参赛
快手推出可灵2.5 Turbo视频生成模型,在力量感、滞空感和物理感知上进步明显。官方称其在文本响应、动态效果等维度效果提升,高品质模式成本降30%。不过,它在物理认知方面仍有欠缺。