「步数蒸馏」共找到 574 篇相关文章
突发!林俊旸被曝创业:新AI Lab估值20亿美元
自3月初离开阿里Qwen团队后,林俊旸动向曝光。外媒消息称他正为新创立的AI Lab筹集数亿美元资金,本轮融资后估值或达20亿美元,高榕创投与红杉资本已接洽投资,他还招募了相关成员。
智谱新模型也用DeepSeek的MLA,苹果M5就能跑
智谱AI上市后发布新成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。
本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B大模型
文章围绕本地大语言模型(LLM)展开,针对实用性和经济性问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型、推理框架等,给出不同配置下性能指标及使用建议,还模拟真实场景测试。
具身智能的「Z 世代」,来了
文章与三位具身智能领域的Z世代年轻人对话,他们有不同背景和经历。谭恒楷研究机器人,提出创新模型和算法;吴铭东专注真机强化学习;王乾旭研究蒸馏特征场。他们对AI有独特认知,展现出年轻人的冲劲和思考。
操控宇宙万物?Gemini3.0生成最火的3D粒子交互案例(圣诞老人、Jarvis)丨附HTML.代码
最近用Gemini 3.0或GPT 5.2做3D粒子交互爆火,能生成可手势操作的爱心、圣诞树等。以往需数天写代码,现在和AI对话几轮就行。文中给出基础提示词,还展示多个案例及HTML代码获取方式。
Nature子刊:港大等首提下一代AI硬件系统,能耗锐减57.2%
港大、港科大与西电团队登上Nature子刊,攻克存算一体架构中模数转换器(ADC)能耗高难题。利用忆阻器可编程特性打造“智能标尺”,使AI芯片功耗降57.2%、面积缩30.7%,为下一代AI硬件开辟新路。
昆仑万维周亚辉投资笔记:AI时代的Super App之战打响|甲子光年
周亚辉认为AI时代Super App数量会大减,价值倍增。他预测张一鸣将成未来首富,字节在AI领域布局广。还提到马云的千问会是豆包劲敌,分析了美团、拼多多等企业在Super App之战中的情况。
DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!
微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。
6.1B激活,三榜开源第一!蚂蚁·安诊儿医疗大模型发布
由浙江省卫生健康信息中心等联合研发的开源医疗语言模型AntAngelMed发布。它基于Ling - flash - 2.0,100B总参数仅激活6.1B达约40B密集模型性能,在多个权威医疗基准测评中居前列,采用三阶段训练流程,高效MoE架构。
原力灵机发布Realtime-VLA V2:从遥操作到真实部署,VLA提速的系统解法
原力灵机发布《Realtime - VLA V2》技术报告,在VLA控制下让机器人快速运动。实现数倍于遥操作采集训练数据的速度执行VLA,解决了遥操作数据采集、时序延迟等问题,还通过“油门式采集”提升速度,但离人类性能仍有差距。