「超算Colossus 2」共找到 3783 篇相关文章
新国产GPU「曦望」,刚融了10个亿
国产GPU公司曦望Sunrise由商汤2024年底分拆独立,时隔半年完成近10亿融资。其产品曦望S1、S2已量产,S3在研发。两位联席CEO分别是百度元老王湛和AMD芯片老将王勇,核心团队规模小但成果显著。
超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭
近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率低。
Thinking Machines又发高质量博客:力推LoRA,不输全量微调
Thinking Machines 博客力推 LoRA 并与全量微调对比。研究发现小数据量任务中 LoRA 与全量微调效果接近,大数据量稍吃力,强化学习中低秩 LoRA 也能接近全量微调。还揭示了 LoRA 关键要素、超参数规律等。
「具身原生」元年!专访原力灵机汪天才,解析具身智能的「PyTorch时刻」
2月10日原力灵机发布开源具身原生框架Dexbotic 2.0,宣布与RLinf合作。合伙人汪天才将其与RLinf结合定义为具身智能的「PyTorch时刻」。还推出具身大模型DM0和应用量产工作流DFOL,推动具身智能进入「具身原生」时代。
李飞飞世界模型公司一年估值暴涨5倍!正洽谈新一轮5亿美元融资
据彭博社消息,李飞飞创办的World Labs正以约50亿美元估值进行新一轮最高5亿美元融资。此前已累计融资2.3亿美元。该公司研发“大世界模型”,推出3D世界生成模型Marble。此外,Yann LeCun创办的AMI Labs也获资本关注。
Nano-Banana 核心团队分享:文字渲染能力才是图像模型的关键指标
谷歌新发布的图像生成与编辑模型Gemini 2.5 Flash Image(Nano - Banana)热度超Grok视频生成。文章通过团队访谈,介绍其图像创作新方式、文字渲染代理指标、交错生成能力等,还对比了与Imagen差异,展望AI终极形态。
MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。
MiniMax深夜开源首个推理模型M1,其上下文能力媲美Gemini 2.5 Pro。M1在部分评测中表现中规中矩,但在MRCR(4 - needle)测试中屠榜。它得益于MiniMax - 01基座模型,应用Lightning Attention机制,开源了40K和80K两个版本。
缔造OpenAI的秘密,竟只有一个词!新智元十年峰会圆桌,七位大咖激辩
新智元十周年圆桌论坛上,七位嘉宾探讨通往AGI与ASI的关键问题,如智能核心、AI能效、游戏与AI关系等。他们认为AI发展超预期,语言是智能核心,实现ASI关键在能耗,还谈及芯片与人脑差距、物理世界发展慢等话题。
Anthropic最新博客:MCP没有死,我们又救活了。
2个月前Eric Holmes认为MCP已死,因其有Token成本等问题且LLM本就会用命令行。但本周Anthropic发博客称想清MCP定位,它不是替代CLI,而是覆盖其到不了的地方,还给出改进方案,MCP月下载超3亿次。
FlashAttention 完全进化史:FA-4 发布之际的技术全景回顾
文章围绕FlashAttention展开,从Attention性能瓶颈引出问题,阐述其各版本演进。FA-1实现算法突破,避免O(N²)内存;FA-2适配架构,提升性能;FA-3深度协同,实现异步;FA-4探索更深异步和角色分工。还探讨跨芯片迁移及未来优化方向。