「中科天算」共找到 2628 篇相关文章
传统云还在「卖铁」,下一代云已在「炼钢」:火山引擎xLLM如何一张卡榨出两张的性能!
大模型上线部署时推理成本高、算力投入大但效果不成正比,企业面临推理效率难题。火山引擎 xLLM 大语言模型推理框架性能极致,成本低,集成关键创新,还被集成到 AI 云原生推理套件 ServingKit 中。
9座新厂之外:台积电现存26 个Fab厂概况一览
台积电作为全球晶圆代工龙头,扩建步伐加快,今年将新建9座厂。本文盘点其现存26座晶圆厂区,涵盖6英寸、8英寸、12英寸晶圆厂及后端封测厂,介绍各厂位置、概况和最新情况。
The Batch:820 | Qwen3 向 DeepSeek-R1 发起挑战
阿里巴巴发布八个大型语言模型权重,含两个 MoE 架构和六个稠密模型。预训练数据达 36 万亿 token,支持 119 种语言及方言。测试中 Qwen3 家族表现出色,或终结 DeepSeek - R1 霸主地位,设计用于智能体系统。
无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%
当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。
别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练
CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。
陈大年复出,入局大模型
国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。
奥特曼最新深度访谈:AI至今没有iPhone时刻!
OpenAI首席执行官山姆·奥特曼在深度对谈中复盘大模型发展,谈及砍掉Sora和自研浏览器聚焦平台,认为AI缺iPhone时刻,还分享ChatGPT决策过程、创业经历,提出从成功学经验等观点,反驳末日论。
DeepSeek Harness规模化踩坑实录:耗时、成本、失败到底该怎么查
Agent 进入日常研发流程后,使用方关注耗时、Token 消耗和失败回溯。DeepSeek Harness(DSH)是开源 Agent 框架,腾讯云 Agent 可观测提供 DSH 采集插件,构成全景可观测方案,还介绍接入实践与其他能力。
打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”
上海人工智能实验室 OpenDataLab 团队发布 MinerU.Chem 技术报告及成果,升级化学文献智能解析能力。它能将化学文献图片转化为 AI 可用数据,解决化学知识机器难用问题,在评测中领先,还将助力 AI4S 发展。
智元下架了首席科学家罗剑岚
量子位发现智元机器人官网合伙人团队名单中,原首席科学家罗剑岚名字不见。此前社媒已有其离职传闻,其个人主页也不再提及智元。此次人事变动时间点微妙,智元刚启动赴港上市流程,具体待官方确认。