「文档视觉编码器」共找到 1290 篇相关文章
Claude Code官方出教程了!创始人分享十大神级技巧,内部团队原来是这样用的
Claude Code 创始人 Boris Cherny 分享内部团队使用 Claude Code 的十大技巧,包括并行处理任务、用‘计划模式’启动复杂任务、投资 CLAUDE.md 文件等,还给出各技巧的具体操作方法及相关文档链接。
一周斩获8k星!港大开源AI学习助手,学练研全流程覆盖,教师也要失业了?
港大开源的DeepTutor是AI个性化学习助手,利用多智能体协作等技术,有文档问答、难题解析等四大核心功能,能构建专属知识库,提供全流程辅导,为学、练、研打造一体化平台。
明年让AI可靠地抢走你的活儿?Anthropic 首席产品官曝新年目标:大模型不拼 “更聪明”,终结“公司上AI,员工更累”尴尬
2025 年智能主体全面爆发,编码领域智能体成突破点,Anthropic 的 Claude Code 表现突出,份额超 OpenAI。其首席产品官 Mike Krieger 梳理发展方向,指出明年重点解决企业部署 AI 但员工未变高效问题。
Minion Skills: Claude Skills的开源实现
Claude推出Skills系统,让AI Agent按需处理专业文档。作者在Minion框架中实现开源版本,介绍设计理念、实现细节,包括技能定义、发现、注册表等,还展示效果、亮点,阐述开源原因与未来方向。
DragonMemory:16倍语义压缩,为RAG应用瘦身
介绍GitHub项目DragonMemory,它针对RAG应用上下文压缩,核心是Dragon v7模型,从序列维度压缩,压缩比达16倍。本地测试效果好,有图形界面,支持多格式文档,开源但非成熟商业产品。
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。
自回归科学基座模型 BigBang-Proton,提出实现 AGI 的新路线
超对称公司发布自回归科学基座模型 BigBang - Proton,挑战主流 AGI 技术路线。它实现多学科问题与 LLM 统一预训练和推理,有三项创新,在多专业任务表现出色,还提出宇宙尺度压缩构想。
【CUDA-MODE学习笔记】Lecture 40: CUDA Docs for Humans(文末送书
本文是CUDA-MODE课程笔记,介绍Modal公司GPU术语词汇表项目,讲师分享职业历程,强调理解CUDA技术栈各层次重要性,还讨论了项目短、中、长期目标,是助力开发者掌握CUDA的教育项目。
一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率
DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。