预取」共找到 378 篇相关文章

算法论文8

AMD新论文颠覆认知:FP4训练不稳定,原因不是随机性不足

大模型训练成本高,降低训练精度可降成本。AMD联合宾州州立大学论文颠覆认知,揭示FP4训练不稳定源于结构性微缩放误差,非随机性不足,还在原生FP4硬件完成大模型训练。

机器之心
产品应用8

比 BeautifulSoup 快 784 倍!这个自适应爬虫框架,我愿称它为下一代 Web Scraping 标杆

文章介绍了自适应Web Scraping框架Scrapling,它能解决爬虫从能跑到跑得稳的问题,具备极速爬、自适应解析等核心功能,适用于电商数据采集等场景,还给出使用方法和项目地址。

小华同学ai
算法论文8

图像编辑缺训练数据?直接从视频中材,仅用1%训练数据实现近SOTA效果

百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。

量子位
算法论文8

集成20+先进算法,优于GPT-4o,自主因果分析智能体来了

加利福尼亚大学圣迭戈分校研究团队提出自主因果分析智能体 Causal - Copilot,集成超 20 种算法。它解决因果分析使用门槛高、训练模型有局限等问题,性能优于 GPT - 4o ,已开源邀全球研究者参与。

机器之心
开源动态8

刷新世界记录!40B模型+20万亿token,散户组团挑战算力霸权

Nous Research推出Psyche网络,用区块链汇聚全球计算资源,启动40B参数大语言模型Consilience训练,达20万亿token创纪录。还解决带宽瓶颈等问题,让AI训练去中心化,推动创新与民主化。

新智元
产品应用7

字节跳动Seed1.5-VL复杂图表精准抽,Deep Think是多模态未来的主流

文章介绍字节跳动的Seed1.5-VL模型,它能精准抽复杂图表,处理模糊图片、推理几何题。其由视觉编码器和LLM组成,训练语料丰富,后训练结合多种方法,推荐在huggingface体验。

CourseAI
新闻资讯8

MIT天才博士刚毕业,就被前OpenAI CTO抢走!年薪或300万起步

MIT天才博士肖光烜刚毕业就官宣加盟Thinking Machines,主攻大模型训练。他履历耀眼,博士论文破解LLM三大难题,构建高效大模型框架。Thinking Machines薪资可观,平均年薪超OpenAI等公司。

新智元
推荐文章7

MCP上下文爆炸怎么办?Anthropic给出了新答案(图文示例)

文章结合Anthropic和Cloudflare关于MCP的文章,指出MCP上下文过长存在工具定义加载和数据反复流经AI两个核心问题,提出让AI写代码调用工具的解决方案,包括按需加载工具和代码在沙箱执行。

AI产品自由
推荐文章7

Langchain创始人最新分享:如何跨越“原型惊艳”到“生产可靠”的鸿沟

近日,LangChain创始人Harrison Chase在Interrupt大会演讲,指出AI行业‘原型易,生产难’痛点。分享优秀Agent工程师四大素质、智能体开发三大关键,还介绍战略判与产品布局,致力于为智能体工程师提供全周期支持。

AI工程化
算法论文7

李飞飞团队新作:DiT不训练直接改架构,模型深度减半,质量还提高了

本文介绍「嫁接」技术,可在小计算算下编辑训练 DiTs 探索新架构。不从头训练,替换算子创建混合架构,保持质量同时减少计算量。还通过实验展示该技术在构建高效架构和文生图模型中的效果。

机器之心