「指令集架构」共找到 2555 篇相关文章
Hugging Face开源顶级模型:双模式推理+128K上下文,最强3B
今天凌晨,Hugging Face开源顶级小参数模型SmolLM3,参数30亿,性能超同类。它有128k上下文窗口,支持6种语言、双推理模式。架构细节等全开放,联合创始人强烈推荐,称是3B领域SOTA。
ThinkChain:一个让Claude边调用工具边思考的开源框架
ThinkChain是展示Claude高级能力的Python项目,其核心创新是将工具执行结果注入Claude思维流,改变AI与工具交互方式。它支持零配置启动,有丰富工具集,还具备交互式命令等特性。
人类程序员依然远强于LLM:为什么说 AI 目前还差点火候
Redis之父Antirez的博文指出人类程序员远强于LLM。他修复Redis向量集缺陷时,与Gemini 2.5 PRO交流,虽其有帮助,但人类跳出固有思维解决问题的创造力是LLM难以企及的。
图解Vllm V1系列4:加载模型权重(load_model)
文章聚焦vllm加载模型权重的流程。从入口函数切入,详细分析DefaultModelLoader的工作步骤,包括初始化模型架构和实际加载权重,还给出各步骤代码及作用,为想操作load_model的人提供框架。
ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力
美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。
CVPR 2026 | EmoStyle:情感也能“风格化”?深大VCC带你见证魔法!
EmoStyle由深圳大学可视计算研究中心黄惠教授课题组完成。它解决图像情感风格化两大挑战,提出有效方法、构建数据集、设计模块。实验显示其平衡情感与内容,还能扩展到文生图。
LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收
LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。
DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。
DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。
挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改
五一期间字节商业化技术团队研发出新一代视觉生成模型,其底层架构是全新的第三条路——生成精炼网络GRN。它能让AI像人一样边画边改,解决了现有模型的问题,在多项基准测试中刷新SOTA记录。
面壁MiniCPM4推理速度3倍,碾压同尺寸Qwen3,阿里上眼药了~
面壁发布包含10个模型的MiniCPM4系列,其推理速度快。它有高效模型架构、学习算法、高质量训练数据和推理系统等创新点,还给出了MiniCPM4实战代码及启用InfLLM v2的参数设置。