「开源深度学习框架」共找到 4622 篇相关文章
所有环节都上最强模型,这可能是做 AI 智能体最贵的错误
开源项目 AgentOpt 指出,很多团队做 AI 智能体默认把最强模型塞进各环节,既贵效果也未必好。真正决定智能体效果和成本的是将合适模型放合适位置,智能体需要能找最优解的模型优化器。
中学生就能看懂:从零开始理解LLM内部原理【九】| 层归一化:神经网络的稳定器
本文是系列文章第九篇,介绍了神经网络中的层归一化。先回顾标准差、标准分概念,指出其可使差异可控稳定。接着说明层归一化将原思想用在神经网络,还加入可学习参数,最后总结其作用与应用位置。
马斯克罕见低头:开源𝕏推荐算法,自嘲“很烂”不过未来月更
马斯克开源𝕏推荐算法系统,这是几乎全由AI模型驱动的系统。它基于Grok - 1同款Transformer架构,通过学习用户历史互动行为推荐内容。虽获社区称赞,但算法有缺陷,马斯克也承认‘很烂’,未来将月更。
Ilya重新定义AGI: 为什么ChatGPT离真正的AGI还很远
OpenAI前首席科学家Ilya在访谈中提出对AGI的新定义,还指出AI规模时代结束,未来拼想法和研究深度。他分析模型评测强但经济影响弱的原因,阐述人类价值函数作用,且SSI战略或调整。
对话付昊桓:数值模拟不能被替代,AI 应该放在哪里丨GAIR 2025
在GAIR 2025大会上,付昊桓教授结合地球系统模型与超算实践,探讨数值模拟与AI的边界和可能。他认为数值模拟是基础,AI可补充,二者应深度融合,还谈及气象领域商业价值和未来期待。
OpenAI总裁透露GPT-5改了推理范式,AGI实现要靠现实反馈
OpenAI总裁Greg Brockman在访谈中透露AGI之路,包括技术上转向强化学习推理范式,资源上持续投入计算资源,落地时封装成Agent。还提到GPT - 5改变推理范式,强调计算对AGI的重要性及模型落地等内容。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
图灵奖得主杨立昆:中国人并不需要我们,他们自己就能想出非常好的点子
本文是对图灵奖得主杨立昆的访谈,他批判当前大语言模型局限性,指出难以靠扩大规模达人类水平AI。还强调理解世界需非生成式架构,如JEPA。同时以DeepSeek为例,称开源发展更快,中国人能想出好点子。
告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」
当前大语言模型长期记忆方案均基于相似度检索,存在结构性盲区,无法在无字面/语义相似时召回关联记忆。腾讯团队提出T-Mem,实现AI联想回忆,已被EMNLP 2026接收,代码开源并上线QQ AI伙伴。
逆天!Mata用13个参数26字节让模型正确率从76%飙升至91%
Meta等机构研究人员发布TinyLoRA极致微调技术,配合强化学习,能在几乎不改变大模型原有结构下,用极少数参数激发其推理能力。该技术在数学推理上表现出色,还探索了参数共享策略和存储精度问题。