「大模型预训练」共找到 9494 篇相关文章
人民想念DeepSeek
文章探讨AI时代Token相关问题。指出其消耗大、价格贵,存储价格上涨使Token降价缺杠杆,虽模型能力提升、MFU优化可降本,但传导到C端取决于商业考量。还回顾大模型价格战,介绍本地部署及芯片创新方案。
10万智能体同场模拟,YuLan-OneSim带来真正的大社会实验
YuLan-OneSim是大语言模型驱动的社会模拟器,能模拟人类社会行为。它可零代码构建场景,有50个默认场景,具分布式架构,支持10万智能体同场模拟,还推出AI社会研究员,自动完成社会科学研究流程。
迈向AI4S 2.0,上海AI实验室开源书生万亿科学大模型Intern-S1-Pro
2月4日上海人工智能实验室开源万亿参数科学多模态大模型Intern - S1 - Pro,为AI4S迈向2.0提供开源基座。其核心科学能力跃升,底层架构创新,科学与通用能力协同发展,还构建了‘算力 - 算法’一体化基座,推动科研范式革命。
没想到,又一个Code Agents瓶颈,被美团&上交大彻底撕开了~
AI写代码能力提升,但打分方法僵化且成本高。上交大与美团论文提出新基准PRDBench,让AI出题人审核,还训练裁判PRDJudge,提升打分准确率与稳定性,促使AI学会‘看懂需求’。
Karpathy强推,大厂抢着「复古」命令行,Star数全都上千了
飞书、钉钉、企业微信接连推出 CLI,GitHub Star 数上千。CLI 是传统人机交互方式,契合大语言模型运作逻辑,国内外多家公司及项目推出相关工具,还给出为智能体构建 CLI 的设计模式。
港科提出新算法革新大模型推理范式:随机策略估值竟成LLM数学推理「神操作」
香港科技大学联合团队提出 ROVER 算法,跳过传统强化学习推理的策略迭代循环。它在多项数学推理基准上超越现有方法,在高难度任务中大幅提高 pass@1 和 pass@256,且提升推理多样性,更轻量。
最高提效8倍!腾讯游戏发布专业游戏AI大模型,美术师做动画不用辣么“肝”了
在Devcom开发者大会上,AI成焦点。腾讯游戏发布游戏创作AI全链路解决方案VISVISE,含动画制作等四大管线,能辅助美术完成重复工作。如MotionBlink可自动补帧,GoSkinning已在多游戏应用,提升了制作效率。
0.01%参数定生死!苹果揭秘LLM「超级权重」,删掉就会胡说八道
苹果研究人员发现大模型中极少量的「超级权重」,即便占比仅0.01%,对模型能力影响巨大。这一发现为大模型「科学瘦身」提供思路,还提出定位方法,助力模型量化和未来研究。
开源AI引爆热潮!GOSIM AI Paris 2025首日直击:80+位技术大咖聊模型、拼算力、秀落地
5月6日,GOSIM AI Paris 2025大会在法国巴黎启幕,80余位技术专家与学者参会。GOSIM联合创始人认为开源AI已追上闭源,AGI或由多模型组成网络。大会设四大分论坛解析开源AI,还有特色单元,明日将迎PyTorch Day。
统一VLA范式!港科大开源StarVLA乐高式架构,复现成本大幅降低
当前具身智能的VLA赛道陷入「碎片化」泥潭,方法难对比、复现成本高。港科大开源StarVLA,提出「乐高式」统一架构,构建模块化开源底座,实现双向模块化,还支持多种训练范式,打通Sim2Real。