「小参数量模型」共找到 8349 篇相关文章

新闻资讯7

AlphaGo开发者创业挑战DeepSeek,成立仅一年目标融资10亿美元

前谷歌DeepMind成员、AlphaGo开发者创立Reflection AI,要开发开源大模型挑战DeepSeek,目标融资10亿美元。其已发布智能体Asimov,较其他模型更受用户偏好,还能捕捉隐性信息,已获少量企业收入。

量子位
算法论文8

73%人类认同率!Video-Bench实现视频质量精准打分

上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。

深度学习自然语言处理
产品应用7

不换 Kimi 底座,1/10 成本追平 Opus 4.7?Cursor 用 Composer 2.5 反击 Claude Code

Cursor 发布 Composer 2.5 应对竞争,虽沿用 Kimi K2.5 底座,但通过后训练提升性能。它跑分接近 Opus 4.7,价格更低,在长任务处理上表现更好,还公布多项技术进展,正推进大模型训练。

InfoQ
新闻资讯8

梁文锋,Nature全球年度十大科学人物!

权威科学期刊《自然》公布2025年度十大科学人物榜单,梁文锋因DeepSeek模型对AI领域的重要贡献与变革性影响成功当选。此外,中国研究员杜梦然也因相关研究入选,还有多位其他领域人物因各自成就上榜。

量子位
开源动态8

重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个

DeepSeek-OCR模型探索视觉-文本压缩边界,用少量视觉token解码出10倍以上文本信息。它在OmniDocBench基准上表现超GOT-OCR2.0,为LLM长上下文问题提供方案,还能处理多类图像与近100种语言。

新智元
算法论文8

谷歌的DeepSeek时刻:LLM推理加速被干到了8倍

谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。

PaperAgent
开源动态7

Moonshot AI发布Kimi Linear技术报告,采用混合线形注意力架构

Moonshot AI在Hugging Face发布Kimi Linear技术报告,该48B参数模型采用混合线性注意力架构,称超越传统全注意力机制。官方数据体现其优势,模型已开源,社区反应不一,MiniMax则回归全注意力架构。

AI工程化
推荐文章8

为什么Claude Code 如此好?「以及如何在自己工作流中复刻Claude Code体验」

本文分析Claude Code好用的原因及如何复刻其体验。作者抓包分析其请求后给出要点,如可调试性优先、保持单一循环、LLM搜索优于RAG等,还阐述控制循环、提示词、工具等设计方法。

AI寒武纪
开源动态8

刚刚,Dexbotic开源!VLA性能+46%,机器人叠盘子100%成功,统一具身智能底座

Dexmal原力灵机开源的Dexbotic是具身智能VLA模型一站式科研服务平台,可提供基础设施。其预训练模型在多仿真器中提升传统VLA策略,还推出开源硬件DOS - W1,覆盖训练需求,架构有创新。

新智元
新闻资讯7

狗子被人类驯化后,脑子萎缩了一半

法国团队研究发现,狗被驯化后大脑容量缩减。35000 - 15000 年前犬类脑容量未缩减,5000 - 4500 年前脑容量比同期狼小 46%,现代家犬比狼小 32%。这或与农业革命人类需求有关,且不意味狗变笨。

DeepTech深科技