「30亿参数模型」共找到 8076 篇相关文章
LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!
文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。
抨击 AI 炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!
Anthropic 由 7 位前 OpenAI 核心成员创立,联合创始人兼总裁 Daniela Amodei 在接受采访时表示,“AI 安全”是核心优势,企业客户对安全性的高要求与之匹配。Anthropic 以“不要相信炒作”为价值观,谨慎对待支出和算法效率。
入侵30家大型机构、Claude自动完成90%?Anthropic 被质疑,Yann LeCun:他们利用可疑的研究来恐吓所有人
Anthropic 称发现‘首个由 AI 协同操作的网络攻击行动’,Claude Code 自动化完成达 90%工作。但外部研究人员谨慎看待,Yann LeCun 质疑其用可疑研究恐吓众人,专业人员也指出报告未达专业标准。
入侵30家大型机构、Claude自动完成90%?Anthropic 被质疑,Yann LeCun:他们利用可疑的研究来恐吓所有人
Anthropic称发现黑客用Claude AI自动化完成90%网络攻击工作,称对网络安全有重大启示。但外部研究人员谨慎质疑,Yann LeCun等认为是可疑研究和营销噱头,专业安全人员也不认可其历史性转折说法。
Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking、还能写侦探小说
阿里发布 Qwen3-Max-Thinking 早期预览版,虽是‘半成品’,在数学推理竞赛中达 100% 正确率。Qwen3-Max-Preview 多项测试领先,速度超 ChatGPT,还成 AnyCoder 默认选项,但未开源。实测表现有优有劣。
30.9K Star牛啊!!再见了PD,不越狱也能装,支持几十种系统,苹果全设备通用!
在苹果生态运行其他系统,Parallels Desktop 收费且移动设备难装。开源工具 UTM 免费,基于 QEMU 构建,支持多架构和系统,操作界面简洁,外围设备支持强,苹果全设备通用。
Copilot强塞马斯克Grok新模型,遭开发者集体“抵抗”!GitHub内部工程师曝:我们是被“胁迫”的
微软旗下 GitHub 深化与 xAI 合作,将 Grok Code Fast 1 整合进 Copilot。但 GitHub 内部举报人指其安全测试不足、团队被‘胁迫’。此引发开发者‘抗议’,部分要求撤销合作,也有人看好合作价值。
微信自研高性能推理计算引擎 XNet-DNN:跨平台 GPU 部署大语言模型及优化实践
本文深入解析微信自研的高性能推理计算引擎 XNet-DNN,介绍其核心技术架构和性能优化策略。该引擎基于 RCI 框架构建跨平台 GPU LLM 推理能力,在多方面超越现有解决方案,还给出了详实对比实验数据。
基于大模型(LLM)的自选股智能分析系统,让AI帮你盯盘,每天自动推送分析报告
daily_stock_analysis是基于LLM的自选股智能分析系统,免费零成本运行,获6.3万Star。它多市场覆盖、聚合多源数据,自动生成决策报告并推送。有零成本运行等五大亮点,还给出上手步骤、适合人群。
光卖模型不够了!OpenAI联合19家顶级投资、咨询、系统公司成立专门公司帮企业落地AI
OpenAI宣布成立OpenAI Deployment Company,收购Tomoro引入约150名工程师。该公司初始投资超40亿美元,有19家机构入伙,将帮企业在核心业务中构建和落地AI系统。