上科大」共找到 6396 篇相关文章

新闻资讯8

Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡

DeepSeek发布新模型DeepSeek - OCR,有诸多技术贡献,获Karpathy等盛赞。它或让文本token输入方式被淘汰。开发者Simon用Claude Code让其在N卡运行成功,分享了详细过程与经验。

AI前线
算法论文8

CNSNS|西工曹文博、张伟伟:克服优化求解器中的损失条件数瓶颈:一种良性损失函数

基于优化的偏微分方程求解方法受关注,但实际慢于经典迭代求解器。本文从条件数角度审视效率瓶颈,指出标准MSE损失导致条件数平方放、减缓收敛。提出稳定梯度残差损失SGR,在收敛速度与稳定性间建立平衡,实验验证其有效性。

力学与人工智能
算法论文8

NeurIPS 2025|CAKE:模型驱动的贝叶斯优化新配方,让黑箱优化更智能、更高效

香港中文学(深圳)等高校研究人员提出 CAKE 方法,被 NeurIPS 2025 接收。它利用语言模型动态设计高斯过程核函数,构建自适应贝叶斯优化框架,在多领域实验中效果优,还具备可解释性。

机器之心
算法论文8

模型推理限再突破:「自适应难易度蒸馏」超越R1蒸馏,长CoT语料质量飞升

本文从中兴通讯无线研究院「模型深潜」团队切入,介绍了首创的「LLM自适应题目难度蒸馏」方法,该方法围绕「模型 - 数据动态匹配」提出了一条完整的CoT构建流程,显著提升了长CoT语料的质量。

机器之心
新闻资讯8

RISC-V×AI生态会暨ArchitStudio用户会成功举办,共绘智能计算生态新图景!

12月26日,‘RISC-V×AI生态会暨ArchitStudio用户会’举办,DSA领域计算实验室揭牌。浦软与隼瞻技将依托其开展研究、转化成果。会各方共话RISC-V与AI融合机遇,还展示了ArchitStudio等产品应用。

芯师爷
8

AI首胜人类博士,顶会论文秒变代码!港90后开源刷爆8k星

香港学黄超团队开源的DeepCode,能分析论文、生成可运行代码。在四基准测试中全面领先,首超人类专家,还优于现有AI Coding。它有三核心能力,采用三阶段框架实现代码自动转换。

新智元
新闻资讯7

百芯竞逐,芯片产业的“新战国时代”

ASIC发展超预期,成AI竞争胜负手。它适配厂专属需求,成本与功耗低,出货量和市场规模将扩容。英伟达GPU虽难替代,但份额会被ASIC蚕食,谷歌TPU已撕开其垄断裂缝,厂纷纷自研ASIC。

芯师爷
新闻资讯8

一图看透全球模型!新智元十周年钜献,2025 ASI前沿趋势报告37页首发

新智元十周年峰会发布《2025新智元ASI前沿趋势报告》与《2025新智元ASI产业图谱》,预测2027达ASI临界,智能体全面爆发。报告展示全球模型格局,中国开源模型表现亮眼,还揭晓了创新奖。

新智元
新闻资讯7

12年首次改!真有人喜欢苹果的“液态玻璃”吗?至少Flutter 开发者的噩梦开始了

在 WWDC 2025 ,苹果宣布在多操作系统引入‘液态玻璃’新视觉风格,是 12 年来最 UI 革新。这或成苹果移动端外观重转变,但也掩盖其 AI 落后现状,还让开发者面临功耗、适配等挑战。

InfoQ
开源动态8

SGLang Team:在 96 个 H100 GPU 部署具有 PD 分解和规模专家并行性的 DeepSeek

本文介绍 SGLang 团队在 96 个 H100 GPU 部署 DeepSeek 的方法。利用 PD 分解和规模专家并行性,SGLang 实现高吞吐量,成本低。博客探讨并行设计、优化方法,所有组件开源,也指出了当前局限与未来方向。

GiantPandaLLM