「视觉语言对齐模型」共找到 1764 篇相关文章
LangExtract:用LLM 一键完成长文档信息抽取与可视化
在2025年大语言模型迅猛发展时,信息抽取成了NLP场景里的“硬骨头”。Google在7月30日开源的LangExtract利用多种LLM,实现“按指令抽取+源文对齐 + 一键可视化”的完整闭环,还给出使用步骤和进阶操作。
Hugging Face 推出九大 AI 课程,免费、全面【收藏】
Hugging Face悄悄上线一批免费AI课程,还带认证证书。课程从大语言模型到扩散模型,从计算机视觉到游戏AI,覆盖面广。完成课程可拿证书,还能在平台分享成果,是学习AI的好机会。
Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键
Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。
沉迷贪吃蛇,7B小模型竟变身「数学天才」!几何推理碾压GPT-4o
NVIDIA等团队提出视觉游戏学习ViGaL范式,让7B多模态模型玩贪吃蛇等游戏,使其在数学、几何等任务击败GPT - 4o。游戏培养通用认知与推理能力,不同游戏提升不同推理能力,多游戏训练效果更佳。
Java 世界的 MCP:将架构策略应用于 LLM 集成
文章指出大语言模型成企业架构组件,但当前集成脆弱。MCP 引入标准化方法,Java MCP SDK 能将其与企业架构融合。文中探讨 MCP 及其 SDK,分析其设计、应用、权衡等,还给出企业运营助手案例。
【万字长文】大模型训练推理和性能优化算法总结和实践
本文总结大模型落地的训练、推理和性能优化算法与实践,介绍语言模型发展,对比BERT、GPT等训练方式,分析生成式大模型问题,还阐述数据处理、推理优化及训练调优等内容,并给出不同场景技术选型建议。
Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?
OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌、Anthropic也有新模型推出。gpt - oss有亮点,但也存在幻觉率高、实测效果差等问题。
两张图就能重构3D空间?清华&NTU利用生成模型解锁空间智能新范式
ICCV 2025中稿的LangScene-X以全新生成式框架,仅用稀疏视图就能构建可泛化的3D语言嵌入场景。它攻克传统方法痛点,将多模态信息统一在单一模型,为空间智能领域打开新大门。
a16z聊AI编程:别担心被取代,新玩家、新范式带来的是「很多」机会
a16z三位投资合伙人认为AI Coding是第二大AI市场,有望成最大单一市场。他们对编程未来不悲观,指出新人群与新方法或催生新软件形态,编程语言不会被取代,资深工程师仍被需要。
张小珺对话OpenAI姚顺雨:生成新世界的系统
OpenAI研究员姚顺雨在播客访谈中分享诸多新颖观点。他认为创业公司机会在设计新交互方式,未来或产生超越ChatGPT的超级应用;还指出语言是实现泛化的工具,强化学习有泛化趋势,智能边界由不同超级应用共同定义。