预训练语言模型」共找到 8330 篇相关文章

算法论文8

全新预训练数据筛选方案,让数据效率提升10倍!配置仅需fastText评分器|港科大vivo出品

香港科技大学和vivo AI Lab提出轻量级高效数据选择方法PreSelect,已被ICML 2025接收。它只需训练部署基于fastText的评分器,减少10倍计算需求,在多数据集实验中效果显著优于其他方法。

量子位
产品应用7

Canva可画联合创始人独家专访:2.65亿用户的Canva,用自研模型,解决了设计的审美问题

Canva月活2.65亿,在a16z排名第三。4月16日开启Canva AI 2.0内测。联合创始人Cameron Adams称,自研模型结合14年数据是护城河,Magic Layers功能验证其价值。Canva要成用户进入AI入口,还会在中国持续投入。

Founder Park
开源动态8

Karpathy最新手搓!复现GPT-2成本狂降600倍:仅需507元3小时训练「最好的AI学习项目」

Andrej Karpathy的个人项目nanochat更新,现训练GPT - 2级别的LLM成本低于100美元,在单个8XH100节点上仅3小时花约73美元,较7年前成本降600倍,还列出关键优化技术,设排行榜。

AI寒武纪
算法论文8

让大模型自己写代码、自己进化,GIM和港大这篇ACL主会,把量化因子挖掘重做了一遍

香港大学和GIM提出CogAlpha框架,将Alpha从‘公式’升级为‘代码’,搭建7层21个智能体探索体系,让大模型参与研究流程。在5个数据集上跑赢21个基线方法,还具可解释性。

机器之心
算法论文8

用「传心术」替代「对话」,清华大学联合无问芯穹、港中文等机构提出Cache-to-Cache模型通信新范式

随着大语言模型发展,多智能体系统中现有T2T交流方式有信息丢失、语义模糊、延迟大问题。清华等团队提出C2C信息传递方式,以KV - Cache为媒介,提升了正确率和速度,还介绍了实现路径、优势及应用前景。

机器之心
算法论文8

《TAML》好文推荐 | 来自清华大学张宇飞团队最新研究成果 基于文本生成翼型:FoilCLIP,一种语言驱动的气动设计新框架

传统翼型设计依赖CFD和风洞试验,成本高。清华大学张宇飞团队提出端到端双向映射框架FoilCLIP,通过对比学习建立文本与翼型几何双向映射,还提出数据增强策略,验证了其在语言驱动设计中的应用潜力。

力学与人工智能
推荐文章8

AI根本杀不死老语言,TypeScript和Python的王朝将会继续!TypeScript之父:没有编译器,AI连重构都不会

前 Meta 资深工程师 Ryan Peterman 对话 TypeScript 之父 Anders Hejlsberg,谈及 TypeScript 编译器从 JavaScript 移植到 Go 的考量,反驳‘AI 将写完所有代码’等论调,指出主流语言地位会因 AI 更巩固,初级工程师不会被取代。

AI科技大本营
产品应用8

神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!

小米全新一代面向 Agent 的大模型家族官宣,包括 MiMo-V2-Pro Preview、MiMo-V2-Omni 和 MiMo-V2-TTS。MiMo-V2-Pro 性能优异,在多场景实测表现出色,技术有创新,API 开放且定价低,已融入小米多业务与生态。

机器之心
新闻资讯8

万人见证,“出轨”CEO被停职;陶哲轩评“OpenAI内部实验模型获IMO金牌”;传字节Seed视觉负责人“暂休”|AI周报

这是一篇AI行业周报,涵盖多领域热点。如Manus季逸超复盘Agent研发经验;陶哲轩评OpenAI模型获IMO金牌;字节跳动绩效改革、人员变动;还有企业动态,像英伟达黄仁勋访华、宇树科技开启上市辅导等。

AI前线
产品应用7

半年研发、1周上线,1秒200行代码爆发?美团研发负责人:靠小团队奇袭,模型和工程能力突破是核心

6月10日美团推出首款AI Coding Agent产品NoCode。美团基础研发平台工程效率负责人程大同在访谈中解答诸多问题,如模型性能优化、产品竞争力、用户使用难点等,还提及产品未来规划和对行业发展的看法。

AI前线