「模型开源」共找到 8972 篇相关文章

新闻资讯8

Jeff Dean:一年内 AI 将取代初级工程师,网友:“Altman 只会画饼,Jeff 说的话才致命”

谷歌传奇工程师 Jeff Dean 在访谈中预测,一年内将有具备‘初级工程师’能力的 AI 系统。他还谈到 AI 发展方向、智能体潜力、大模型格局等,也提及硬件重要性及 AI 在科研领域的影响。

AI前线
开源动态7

谷歌 Java 代理开发工具包新增 LangChain4j 集成

谷歌 Java 代理开发工具包(ADK)0.2.0 版本集成了 LangChain4j,显著扩展功能,让开发者能使用更多模型。谷歌开发者 Guillaume Laforge 解释其优势,ADK 还引入系列增强提升性能。

InfoQ
算法论文8

Meta通过简单算术解锁LLM SoTA性能

大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。

深度学习自然语言处理
算法论文8

LLM 竟然会内省!Anthropic 整了个大活:首次揭开 AI 意识

Anthropic最新研究《大语言模型中涌现的内省意识》,首次通过直接操控模型内部状态验证AI能否觉察自己思想。研究采用概念注入技术,发现AI有内省能力,且不同模型表现有差异。

PaperAgent
算法论文8

CoT推理大溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」

新研究揭示思维链CoT会分散模型「注意力」,使大模型推理时易出错。研究指出在需遵守指令任务中,用CoT推理模型准确率下降,还总结了四大模式,并提出四种缓解策略。

新智元
推荐文章7

从零开始200行python代码实现LLM

文章从传统思路实现诗词生成器入手,介绍了词汇表、Bigram模型等概念,接着用Python和PyTorch实现了真正的Bigram模型,阐述模型、训练等内容,最后回顾成果,下一篇将基于此实现完整GPT。

OpenMMLab
推荐文章9

梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

本文深度梳理了DeepSeek梁文锋过去三年署名的11篇AI核心论文,还原其从成本破局到Agent基础设施卡位的底层技术路线,拆解各论文核心突破,展现中国大模型差异化竞争路径。

AI科技评论
推荐文章7

从 GPT 到 Agent,技术与业务如何“双向奔赴”

InfoQ《极客有约》X AICon 直播栏目邀请徐文健、李陈忠、张昊阳探讨大模型产品落地路径。他们分享从 GPT 到 Agent 的经历、认知转变,讨论通用 Agent 及创业机会,还谈及 AI 产品难点和人才标准变化。

InfoQ
新闻资讯8

GPT-6 Sol和Opus 5.2同时灰测!奥特曼阿莫迪周末刚喊刹车,一上班就踩油门

本文爆料OpenAI和Anthropic同步灰度测试新一代大模型GPT-6 Sol和Claude Opus 5.2,对比了模型性能提升,同时提到OpenAI GPT-5.5即将退役,带来AI大模型领域最新前沿动态。

量子位
算法论文7

The Batch:826 | 提高输出准确性的记忆层

通常提高大语言模型事实准确性需更大模型规模,会增加计算成本。Meta研究人员在transformer架构加可训练记忆层,可高效存储提取信息,提升计算效率,测试显示其能提升模型输出质量。

DeeplearningAI