「长文本优化」共找到 2126 篇相关文章
Meta刚刚开源DINOv3,横扫60+任务,无标注封神!
今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。
JinaVDR: 一个图文混排文档搜索任务的基准集
现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。
ChatGPT居然也推出防沉迷模式了
ChatGPT推出防沉迷模式,超时长会提醒休息。OpenAI副总裁称周活用户达7亿,较去年增4倍。此前ChatGPT曾因回答问题不当回滚更新。同时,OpenAI完成83亿美元融资,估值达3000亿美元。
Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签
在计算机视觉领域,获取带标签数据成本高、耗时长。开源项目 lightly-train 用未标记图像和视频自监督预训练,减少标注成本与时间,可集成到现有训练管道,支持多种模型架构和应用场景。
马斯克Grok这个二次元「小姐姐」,攻陷了整个互联网
今天凌晨马斯克通知更新Grok APP,推出基于Grok 4大模型的「智能伴侣」功能,付费用户可优先用新「数字伴侣」头像。此外Grok还在游戏领域出击,开发者用提示词就能生成可玩游戏,效率大增。
Gemini 2.5 Pro 是怎么炼成的?-- gemini 2.5 技术报告阅读笔记与思考
文章是 Gemini 2.5 技术报告阅读笔记。介绍其成功点有多模态、LongContext、思考能力;还阐述模型结构、训练和数据情况,以及代码、事实性、长上下文等特定能力的提升,最后提到基于其构建的智能体。
OpenAI首席科学家:发布前夜,我们差点砍掉ChatGPT!5个你不知道的惊险内幕。
文章分享OpenAI最新PodCast内幕。ChatGPT最初名又长又没记忆点,发布前夜高层因测试结果存争议。上线炸服,还曾因RLHF问题成“马屁精”。未来AI将向智能体化发展,招聘看重好奇心等能力。
基于OpenAPI和AI coding的上云智能体构建实践
文章介绍基于OpenAPI和AI coding构建上云智能体的实践。分析不同编程范式,结合AI coding发展与Multi - Agent问题,阐述构建方案,包括业务场景、构建方法、技术实现、当前效果及后续展望,还提及文档智能与RAG构建LLM知识库。
无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab
多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。
谢赛宁团队新作:不用提示词精准实现3D画面控制
谢赛宁团队新发布的Blender Fusion框架,结合图形工具 (Blender) 与扩散模型,让视觉合成不再仅依赖文本提示,实现精准画面控制。其核心是对现有技术高效组合,还透露两项训练技巧提升泛化性。