视觉 - 语言数据」共找到 3778 篇相关文章

算法论文7

近期,不错的LLM Agent统一记忆框架综述~

随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据集复现比较10个方法,还设计出新的低token开销框架。

PaperAgent
新闻资讯8

两位95后打造“伴身智能”硬件,获商汤国香、奇绩创坛千万元级投资|甲子光年

两位95后Jasper和Xander成立弦指科技推出智能戒指Wilo,获商汤国香、奇绩创坛千万元投资。他们想定义“伴身智能”,用戒指采集数据形成个人世界模型,还将搭建开放生态。

甲子光年
推荐文章7

Reorx:OpenClaw 正在重塑我的数字生活,以及为什么我退订了所有 SaaS

知名技术博主 Reorx 记录用 OpenClaw 将工作流从“云端租赁”迁回“本地私有”的过程。AI 正从云端服务变为本地基础设施,他退订 SaaS 用 OpenClaw 重塑数字生活,虽有不足但能拿回数据控制权。

AI科技大本营
推荐文章8

Cursor 浏览器翻车后,这个团队做出AI规模化高可靠软件工厂

Cursor用AI构建浏览器失败后,MoonBit团队用新路线,10天生成商业级C编译器。其语言设计、AI安全重构、工具链等方面优势明显,还支持多种后端,有望推动软件工程迈向自动化。

InfoQ
产品应用7

豆包也开始抢程序员饭碗了,首个编程模型来了!

字节给豆包升级编程能力,推出首款编程模型Doubao - Seed - Code。它刷新国内编程模型上下文长度,支持视觉理解,API价格良心。经测试,虽未达全球顶尖,但弥补国产编程模型短板。

开源星探
算法论文8

Meta这两篇最新Agent Learning论文,有些意思!

分享Meta SuperLabs两篇Agent Learning论文,从‘如何低成本获得高质量经验’出发,形成技术链,为语言智能体进入‘规模化RL时代’提供路线图,还分析了Agent RL问题及两论文成果、对比。

PaperAgent
开源动态8

腾讯重磅开源:端到端文档转换VLM,中英文错误率双料最佳!

腾讯开源端到端文档转换视觉模型POINTS - Reader,可将文档图片转结构化文本。它基于POINTS1.5架构,支持中英文。在OmniDocBench基准上,中英文错误率暂列最佳,具零后处理简单等亮点。

开源星探
新闻资讯8

来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!

OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。

新智元
算法论文7

“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%

文章聚焦多模态长文档视觉问答,介绍现有LVLM - based和RAG - based技术路线及困境。提出MMRAG - DocQA方案,引入‘分层索引 + 多粒度检索’,设计双索引建模相关性与依赖,用互补策略实现证据互补。

CourseAI
开源动态8

谷歌开源高效文本提取 Python 库LangExtract

谷歌开源 Python 库 LangExtract,能用大语言模型从非结构化文本提取结构化信息。它定位精确、输出可靠,支持多模型,适应多领域,还能处理长文档,通过示例介绍了使用方法。

GitHubStore