「大模型开源」共找到 10302 篇相关文章
刚刚,DeepSeek 突发梁文峰署名新论文:V4 新架构提前曝光?
今天凌晨,DeepSeek在其GitHub官方仓库开源了新论文与模块Engram。该论文提出“查—算分离”机制,通过引入可扩展的查找记忆结构,在等参数、等算力条件下提升模型表现,代码与论文全文均已开源。
GPT之父把AI扔回1930年:没见过一行代码,却「发明」了Python!
GPT之父Alec Radford带队发布总参数130亿的大模型「talkie」,其训练数据冻结在1930年,没学过编程却能写Python代码,证明LLM可用旧知识推理。团队后续还有升级计划。
万字对谈 Physical Intelligence(π):具身智能的卡点和下一步突破,到底在哪?
本文是对Physical Intelligence联创兼CEO和核心研究科学家的访谈。他们探讨具身智能现状,指出当前瓶颈是智能软件,还谈到VLM性能、数据收集、模型训练等问题,认为通用机器人基础模型被低估。
小红书,再造一个更有「声」命力的社区
2026年春节,小红书开放多种AI语音新玩法,如语音发布、评论、问一问等,增强社交趣味性。但AI语音落地面临音频理解、生成活人感和响应速度等问题。小红书有天然优势,技术团队自研模型达SOTA水平。
关于 AI Agent,你最想知道的 3 个问题——为什么我说“垂直 Agent”是个伪命题
文章解答了关于 AI Agent 的三个读者问题,包括概念定义、大厂推出的原因及商业化前景、通用与垂直类 Agent 的商业前景。指出 Agent 是 AI 落地有价值方向,目前有挑战,真正机会在围绕其构建的数据、工具和行业理解。
无需训练的3D生成加速新思路:西湖大学提出Fast3Dcache
在AIGC浪潮中,3D生成模型虽进化快,但‘慢’和计算量大制约其应用。西湖大学AGI实验室提出无需训练、即插即用的Fast3Dcache框架,能在加速同时保持或提升模型几何质量。
中学生就能看懂:从零开始理解LLM内部原理【八】| 什么是残差连接?
本系列是对长篇文章《Understanding LLMs from Scratch Using Middle School Math》的解读笔记。本篇介绍残差连接,指出传统多层模型有网络退化和梯度传导困难问题,而残差连接能缓解,还说明了其工作原理和可行性。
汉字防AI作弊!甩英文、拉丁文十几条街
中科院等联合发布 Chronicles-OCR 基准测试,让 20 多个主流视觉大语言模型识别汉字演变史。结果显示,模型在古文字识别上表现糟糕,还存在靠认材质作弊情况,暴露了 AI 理解汉字的局限。
灵初智能陈源培:一个 00 后的机器人之梦
00 后陈源培是灵初智能联创,本科土木工程专业,大二因比赛对机器人感兴趣。他研究灵巧手,参与开源项目,灵初发布相关模型。他认为强化学习对灵巧手重要,还谈了模型、创业、落地等看法。
OpenAI未公开的o3「用图思考」技术,被小红书、西安交大尝试实现了
OpenAI推出的o3推理模型打破传统文字思维链边界,实现图像融入推理过程。小红书与西安交大联合构建多模态深度思考模型DeepEyes,尝试实现类似能力,还开源技术细节,在多任务中表现出色。