新架构」共找到 4965 篇相关文章

开源动态7

从文心开源谈起,论大模型发展生态

6月30日百度宣布开源ERNIE 4.5即文心4.5系列模型,实现预训练权重+推理代码完全开源。文心团队提出创新架构,增强多模态理解能力。今晚7:30,CSDN邀专家深度解读文心开源及行业趋势。

AI科技大本营
产品应用8

DeepSeek-OCR 2 架构性能暴涨 3.73%

DeepSeek-OCR 2核心技术突破集中于DeepEncoder V2架构与端到端优化。如视觉Tokenizer低参高效压缩Token,LLM式视觉编码器用双流注意力驱动因果建模等,还采用三级训练流水线提升效率。

CourseAI
新闻资讯8

Anthropic 反杀 OpenAI,LLM 企业市场格局

Menlo Ventures 报告显示,Anthropic 超越 OpenAI 成企业 LLM 市场王者。代码生成成杀手级应用、强化学习成扩展路径、Agent 时代到来支撑其胜利。企业重性能,支出从训练转向推理。

AI工程化
开源动态8

Qwen3成员:Embedding系列模型登场!

今天正式发布Qwen3-Embedding系列模型,专为文本表征等任务设计,继承Qwen3多语言理解优势。在多项基准测试表现卓越,已在多平台开源,有卓越泛化性、灵活架构与多语言支持等特点。

通义千问Qwen
开源动态8

DeepSeek开源的不仅仅是个OCR模型。。。

DeepSeek开源3B参数的OCR模型,重思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。

AI工程化
算法论文8

TreeHop:无需LLM的高效多跳问答范式

多跳问答(MHQA)任务有挑战,现有方法依赖LLM,计算成本高、延迟显著。TreeHop研究提出方案,摒弃LLM,通过嵌入空间动态更,降低延迟、减少模型参数量,还在主流数据集表现佳,适合工业应用。

深度学习自然语言处理
新闻资讯8

刚刚,扎克伯格宣布成立Meta超级智能实验室

Meta宣布进入超级智能赛道,扎克伯格成立Meta超级智能实验室,任命前Scale AI CEO为首席AI官。MSL整合多团队,Meta还投资Scale AI,为抢人才不惜重金,团队成员来自顶尖实验室,Meta有独特优势。

AGI Hunt
新闻资讯7

Pony Alpha模型炸场!全球「猜爹大赛」开启

2月7日深夜,OpenRouter悄悄上线匿名模型Pony Alpha,其编程、推理等体验出色,外网瞬间疯传。全球开启‘猜爹大赛’,Claude、DeepSeek、Grok、GLM各派开吵,还凸显了‘匿名盲测式发布’打法。

新智元
新闻资讯8

Open AI 模型在 IMO 2025 上获得金牌!

OpenAI模型在2025年国际数学奥林匹克(IMO)中达金牌水平,测试时不借助工具、不连互联网,且不太可能存在数据污染。该模型解决6题中的5题,非GPT - 5,近期也不发布。

歸藏的AI工具箱
开源动态8

首个基于 MCP 架构的低代码 RAG 框架

检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统。

GitHubStore