「语言探索」共找到 1757 篇相关文章
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM多任务处理潜力,为自动驾驶等领域带来前景。
好奇心之旅:Cursor代码库索引机制的学习笔记
作者作为高德信息工程团队AI先锋队一员,日常用Cursor开发,因好奇其代码库索引机制展开探索。介绍了Cursor索引工作流程、隐私安全等,还研究Merkle树、turbopuffer向量库及开源方案Continue。
DeepSeek-R1发布100天后:全面复盘推理大模型复现研究及未来!
推理语言模型(RLMs)发展显著,DeepSeek - R1发布引发广泛影响且未完全开源。MiroMind等总结其复现研究,关注SFT和RLVR方向,介绍数据构建、方法设计、训练过程细节及实验关键发现。
全网开测GPT-oss!技术架构也扒明白了
全网开测GPT-oss,它登顶开源模型王座,性能比肩o3-mini、o4-mini,适合本地推理。网友探索出多种用法,还推出Pro版。其架构也被扒出,官方介绍了微调方法,吴恩达等大佬也参与测评。
五倍推理加速,激发自回归潜能,苹果新工作让LLM预测未来
近年来自回归训练方法成语言模型主流范式,但推理阶段计算开销大。苹果研究人员开发框架,让预训练自回归大模型多 token 预测,代码和数学任务推理加速达 5.35 倍,一般任务约 2.5 倍。
vivo突破手机AI部署难题,绕开MoE架构限制,骁龙8 Elite流畅运行|ICCV 2025
在AI多模态时代,‘让大模型上手机’成焦点。现有MLLM在手机端部署有难题,vivo AI研究院等团队提出GenieBlue方案,绕开MoE架构限制,在骁龙8 Elite芯片手机流畅运行,保持语言性能同时实现多模态表现。
Cache Me If You Can:陈丹琦团队如何「抓住」关键缓存,解放LLM内存?
普林斯顿大学陈丹琦团队新论文聚焦长上下文语言模型 KV 缓存问题。传统 KV 缓存大小随输入文本长度线性增长,此前方法难公平比较。团队提出「KV 足迹」指标,改进方法并推出 PruLong 优化内存,节省空间且保性能。
为什么最有价值的AI讨论总发生在知乎?
AI成全民话题,但网上多是热点复述,真正有价值的理解和方法论沉淀在知乎。知乎答主toyama nao、德里克文、Jeff Tao陶建辉分别作为记录者、探索者和建设者,在AI领域深度探索,推动认知沉淀。
视频字幕处理开源神器
卡卡字幕助手(VideoCaptioner)操作简单,无需高配置,支持 API 和本地离线语音识别,利用大语言模型处理字幕。它支持多平台视频下载处理,有专业语音识别引擎,能智能纠错、高质量翻译、调整字幕样式。
清华首提通用大模型滤波方法,实现零样本状态估计|NeurIPS'25
清华大学李升波教授团队在NeurIPS 2025提出LLM - Filter通用滤波器,将状态估计融入大语言模型推理框架。它能解决传统方法泛化性差问题,在未见过系统中实现零样本状态估计,有望成基础模型。