「芯片性能」共找到 2439 篇相关文章
10岁寒武纪,迎来好日子
常年亏损的寒武纪在2024年四季度和2025年一季度连续单季盈利,2025年一季度营收同比大增4230.22%。其云端产品线贡献大,受益于英伟达芯片出口受限。不过,它在生态和战略上与英伟达有差距,还面临诸多竞争。
Fable 5.1变身Token刺客,几分钟烧光额度!AI圈掀起「榨汁革命」
Anthropic发布的Fable 5.1虽性能强但极耗Token,引发开发者不满。当前AI产业面临算力饥渴与Token通胀问题,企业落地AI痛点多。迅策科技的TokenCloud平台能助力企业高效转化Token,还介绍了其配套产品TokenOS。
视频生成比播放还快:开源VDN-H3,14秒视频11秒搞定
近期,网络出现“无限流”视频,源于MiniMax H3。OpenVDN团队开源Video Delta Net(VDN),基于MiniMax H3使视频生成速度提升75到90倍,14.4秒的768p视频11.23秒就能生成。它采用混合思路,性能提升显著。
阿里 Qwen3.8 正式发布:2.4T 规模,自主编程 16 天搓出一个 Hermes Agent
8月3日,阿里发布新一代基座大模型Qwen3.8,总参数量2.4万亿,编程和办公能力提升,在权威榜单中表现出色。其API已上线,价格有优势。‘千问办公’公测,Qwen3.8性能强大,还适配阿里真武M890超节点。
GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」
大模型推理能力难迁移到小模型,现有强化学习方法如GRPO在小模型上性能提升有限。香港中文大学(深圳)唐晓莹教授团队提出G²RPO - A算法,缓解小模型奖励稀疏问题,在多模型实验中表现优于vanilla GRPO。
不可思议!400B大模型在iPhone上跑起来了
一个跑在 iPhone 17 Pro 的 A19 Pro 芯片上的 400B 大模型 Qwen3.5 - 397B - A17B 引发关注。这源于 Flash - MoE 开源项目,它摒弃现代 AI 框架,回归底层开发,实现消费级硬件上大模型交互级速度运行。
原生理解生成统一:商汤开源SenseNova U1,用统一架构终结「缝合怪」多模态
商汤开源日日新 SenseNova U1 系列原生理解生成统一模型,采用 NEO-unify 架构,只需 8B 小参数就能实现很多商业闭源模型效果。在多测评维度性能领先,还能实现连续性图文创作输出,解决理解与生成断层问题。
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
合肥工业大学与科大讯飞联合团队提出全新低秩参数修剪框架 ProSafePrune,被 ICLR 2026 录用。它能精准定位模型认知偏差并修剪,降低过度拒绝率,不损安全防御能力,还提升通用任务性能,为 LLM 安全部署提供新思路。
开门红!首钢园中关村通力进入首批“国家级科技型企业孵化器”公示名单
近日,落户北京首钢园的中关村通力科技孵化器入选工业和信息化部科技型企业孵化器(第一批)名单。它聚焦芯片等根技术,已孵化超300家企业,融资超百亿。未来将定位‘AI原生孵化器’,构建全栈赋能生态。
超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26
大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。