手写文本识别」共找到 727 篇相关文章

新闻资讯7

Anthropic 发布最新研究:LLM 展现初步自省迹象

Anthropic 最新研究表明,Claude 展现出真实但有限的内省能力,能在某种程度上识别自己内部状态。研究团队开发验证方法,通过概念注入等实验进行测试,还发现认知控制证据等,不过该能力有局限。

AGI Hunt
推荐文章8

视觉生成的另一条路:Infinity 自回归架构的原理与实践

本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。

InfoQ
产品应用8

小说一键转有声剧!豆包语音团队提出「AI多人有声剧」方案,沉浸感拉满了

豆包语音团队发布「AI 多人有声剧」自动化方案,基于多角色 Seed - TTS - 2.0 模型,实现从小说文本到有声剧成品端到端 AI 制作,成本和周期大降,首批有声剧已在番茄小说 App 上线。

机器之心
新闻资讯8

西湖大学打造了一个AI科学家,突破人类SOTA,还能自己发论文

西湖大学文本智能实验室推出能自主探索的AI科学家DeepScientist,两周完成人类三年科研量。它在三个前沿AI任务刷新SOTA纪录,还能写论文。文中介绍其科研历史、工作方式、成果及面临的伦理问题。

AIGC开放社区
算法论文8

大模型破译甲骨文创下新SOTA!复旦团队推出新框架

复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,还能为未破译甲骨文输出可解释分析文本,助力考古工作。

量子位
算法论文8

dLLM的「Free Lunch」!浙大&蚂蚁利用中间结果显著提升扩散语言模型

近年来,扩散大语言模型(dLLM)成为文本生成新势力,生成效率高。但现有解码策略忽视中间迭代信息,研究团队观察到「先对后错」现象,提出 TCV 和 TCR 方法,显著提升模型在推理任务表现。

机器之心
开源动态8

字节开源终身记忆多模态智能体,长时记忆+RL,实测超Gemini‑GPT4o!

字节开源全球首个带终身记忆更新的全多模态智能体M3 - Agent,给其装上‘长期记忆’大脑。它构建实体记忆图谱解决现有Agent问题,架构含两个流程,代码实现有特色,跑分数据出色。

探索AGI
开源动态8

是「福尔摩斯」,也是「列文虎克」,智谱把OpenAI藏着掖着的视觉推理能力开源了

智谱开源视觉推理模型 GLM-4.5V,还同步开源桌面助手应用。此模型视觉推理能力强,在图像识别、视频理解、前端复刻、图表处理等多方面表现出色,技术创新使其达开源 SOTA 水平,推动行业注重实用价值。

机器之心
产品应用8

Genie 3,让幻觉持续成为现实

Google最新发布的Genie 3能从文本生成交互式世界,实现24fps实时交互,分钟级一致性,720p分辨率。它取长补短,有出色记忆能力,物理表现自然,还能让智能体完成任务。不过目前是有限预览,有不足。

AGI Hunt
算法论文7

实时生成视频!StreamDiT每秒16帧,单卡生成

现有文本生成视频模型多为离线生成,无法满足实时交互需求。加利福尼亚大学与Meta联合提出StreamDiT模型,采用流匹配等方法,蒸馏模型可单卡每秒16帧实时生成512p视频,不过仍有伪影问题。

带你学AI