DeepSeek-V3.1」共找到 3673 篇相关文章

开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
开源动态8

DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?

凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期层节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。

PaperAgent
7

梁文锋首次开口融资,DeepSeek只估值680亿,融资20亿?

据媒体报道,AI初创公司DeepSeek正洽谈以100亿美元估值融资至少3亿美元。该公司此前拒绝融资,此次或因自建数据中心、研发新模型等需大量资金。同时,其两位核心人员跳槽,人才竞争激烈。

机器之心
算法论文7

DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案

DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。

机器之心
开源动态7

Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小

Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。

InfoQ
新闻资讯8

LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4

近期大模型长上下文需求增长,成本问题凸显。Google Gemma 4、Poolside Laguna XS.2、Zyphra ZAYA1 - 8B、DeepSeek V4 等模型各有架构优化,如 Gemma 4 跨层 KV 共享和 PLE,以降低长上下文推理成本。

机器之心
开源动态8

SD又回来了!一秒出图,手机就能玩:SD3.5-Flash让专业AI绘画进入“闪电”时代

Stability AI联合萨里大学SketchX实验室推出SD3.5-Flash模型,能在普通电脑甚至手机上快速生成专业级高分辨率图片。它将推理步骤压缩、显存要求降低、出图时间大幅缩短,画质也没明显缩水,还在性能上反超SD3.5M。

AIGC开放社区
新闻资讯7

马斯克曝光Grok 5!1.5万亿参数,偷师Cursor狂练编程

5月25日凌晨马斯克官宣,1.5万亿参数Grok V9-Medium训练完成,2 - 3周后发布。训练灌入大量Cursor编程数据,编程能力将大幅提升。此前v8 - small年底前开源,马斯克编程赛道布局全面摊牌。

新智元
新闻资讯8

Gemini 3.5深夜登场,谷歌CEO劈柴亲自算账:速度快4倍、一年还省超10亿美元,曝内部已被颠覆

北京时间5月20日凌晨,谷歌I/O开发者大会开幕。谷歌CEO展示惊人数据,发布Gemini 3.5、Gemini Omni等新品。Gemini 3.5速度快、成本低,改变谷歌内部工作方式;Omni可生成视频;还为Gemini应用和搜索框带来升级。

InfoQ
开源动态7

一键式训练端到端Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的端到端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。

GiantPandaLLM