「可灵3.0」共找到 6080 篇相关文章
GPT5.5代号“蒜你狠”曝光!OpenAI拉响红色警报加班赶制新模型,最快下周就发
面对谷歌攻势,OpenAI奥特曼拉响“红色警报”,集中资源让ChatGPT赶上Gemini 3 Pro。两款新模型曝光,一款下周发布,代号Garlic的明年初或发。ChatGPT流量降,OpenAI财务压力大,Garlic能否助其破局受关注。
论文深度解读:大模型(LLM)加持下的自主无人机分层智能体框架,实现自主规划
文章解读《A Hierarchical Agentic Framework for Autonomous Drone-Based Visual Inspection》论文,介绍分层智能体框架让无人机群自主规划。研究对比三种‘思考模式’与不同‘大脑’组合,还指出未来研究可开发混合系统、混合能力智能体及自适应系统。
Anthropic刚刚宣布Claude Sonnet 4支持100万token上下文窗口
Anthropic官方公告,Claude Sonnet 4上下文窗口扩大到100万tokens,是之前5倍。能一次读懂大代码库或多篇论文,可用于代码分析、文档处理等。超20万tokens价格翻倍,现仅对Tier 4用户测试。
AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起
文章梳理大语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。
The Batch: 845 | 没有理由的“推理”
研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。
实时生成视频!StreamDiT每秒16帧,单卡生成
现有文本生成视频模型多为离线生成,无法满足实时交互需求。加利福尼亚大学与Meta联合提出StreamDiT模型,采用流匹配等方法,蒸馏模型可单卡每秒16帧实时生成512p视频,不过仍有伪影问题。
OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力
主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。
【博客转载】Row-Major VS Column-Major
文章探讨行主序和列主序存储多维数组的差异,以及对矩阵乘法性能的影响。指出不同存储顺序组合下矩阵乘法的偏好,还通过C++单线程实现和cuBLAS库验证分析,表明优化可减少性能差距。
DeepSeek发布最新论文,5大杀手锏让大模型训练、推理暴涨
全球著名开源大模型平台DeepSeek在huggingface发布超强开源模型V3的论文,从硬件架构和模型设计双视角探讨高效训练和推理,提出DeepSeek - MoE、多头潜在注意力等创新技术,解决内存、计算效率等难题。
NVIDIA 入局量子基础设施:Ising 模型主打自动校准与实时纠错
NVIDIA宣布推出开源NVIDIA Ising模型,解决量子处理器校准和纠错问题。它含校准和解码两组件,速度和准确性优,可本地部署。与传统方法不同,它是与硬件无关的开源模型层,社区反馈有期待也有疑问。