大模型预训练」共找到 9494 篇相关文章

新闻资讯7

AI为啥不懂物理世界?李飞飞、杨立昆:缺个「世界模型」,得学脑新皮质工作

近来,杨立昆计划离开Meta创立以‘世界模型’为核心的AI公司;此前李飞飞也发文指出语言模型弊端,强调建立‘世界模型’重要性。该模型源于对语言模型局限的反思,能让AI理解物理世界。

量子位
算法论文8

AGI真方向?谷歌证明:智能体在自研世界模型,世界模型is all You Need

谷歌DeepMind研究人员表明,通用AI智能体处理复杂长期任务需学习内部世界模型,还证明可从智能体策略提取该模型。此研究成果补充多领域,对AI发展和安全意义重

机器之心
开源动态7

被DeepSeek带火的OCR,最新8个开源模型盘点~

DeepSeek-OCR发布让OCR热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。

PaperAgent
算法论文8

模型“拼好题”,45K数据撬动18%提升,数学问题拒绝死记硬背 | MathFusion

上海AI Lab等团队提出MathFusion,通过三种“融合策略”生成新的融合数据集MathFusionQA,仅用45K合成指令,在多基准测试中平均准确率提升18.0个百分点,增强模型解决数学问题的能力。

量子位
产品应用8

昨晚,OpenClaw更新,亲手终结「旧插件」时代

昨晚OpenClaw重版本更新,内容多到需单独做目录梳理。重点在ClawHub插件市场、多模型支持等。最重要变化是插件生态重心转向,且体系改、工具能力收敛,还在多方面有更新,创始人指出正式版有功能加载问题。

机器之心
开源动态8

WRC整理床铺机器人背后模型曝光!端到端双系统全身智能VLA,仅凭少量微调就能get任务

星海图在2025WRC展示G0模型,可让机器人自主完成铺床任务。其发布端到端双系统全身智能VLA模型G0,结合真机数据集与架构,还构建开放数据集,评测结果优于π0模型,即将开源。

量子位
开源动态8

jina-embeddings-v5-omni 发布!全模态向量小模型

Jina AI发布`jina-embeddings-v5-omni`,将`v5-text`能力拓展到多模态。`v5-omni-small`参数量小却追平LCO - 7B,在多模态评测中表现优异,但视频是短板。其采用‘冻结 + 投影’架构,训练快、省显存。

Jina AI
开源动态8

The Batch: 849 | 用于训练网页智能体的生成数据

开发网页智能体常需量人力标注训练样本,卡内基梅隆学与亚马逊团队实现训练数据生成自动化。他们构建数据集,通过智能体工作流程生成数据,微调后 Qwen3 - 1.7B 表现出色,还公开数据与方法。

DeeplearningAI
新闻资讯7

80%到25%逆转!模型代码能力最新排名:Anthropic不再是唯一的神?

OpenRouter网站有模型使用排行榜,按不同使用场景分类。2024年12月到2025年2月,Anthropic模型编程流量占比曾达80%,后谷歌Gemini 2.5 Pro等抢占份额,其跌至25%以下,Claude 4发布后份额回升。还介绍了OpenRouter特点。

AI寒武纪
推荐文章7

200行python代码实现从Bigram模型到LLM

本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。

阿里云开发者