「模型架构」共找到 8678 篇相关文章
打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26
现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。
26.7K 标星!GitHub 高分教程 Learn Claude Code:12 节课带你手搓一个 Cursor!
Learn Claude Code是shareAI - lab开源教学项目,目标是让人理解AI编程Agent工作原理。它有12节课,每节加一个机制,逻辑清晰。配交互式Web平台,文档‘心智模型优先’,还提供后续项目助知识落地。
复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论
复旦大学、北京大学联合美团LongCat提出Block Diffusion推理模型Test-Time Scaling新框架TDAR,引入‘粗思考,细求证’范式与有界自适应置信度解码,打破速度与精度零和博弈,在多基准测试表现出色。
对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容
本文对话 Seede AI 创始人 Longyi,探讨 AI 设计产品发展。Seede AI 主打将原始素材转化为可交付设计稿,易上手、受众广。创始人认为不转向 AI - Native 没救,产品已跑通 PMF,目标是帮人类理解 Agent 产出内容。
我们给OpenClaw加了一双眼睛,来观察我们这平凡的一天。
内容创意组小伙伴用Pocket 3作OpenClaw的“眼睛”,俯拍工位区,截取图片喂给多模态模型描述场景,下班时让OpenClaw分析趣事。还开发了“OpenClaw人类观察计划”,开发过程简单,降低了Agent体验门槛。
让问题不过夜:交易领域“问诊”Agent实践
文章针对研发支持中的痛点,构建智能Agent系统,将问题抽象为业务答疑与问题诊断两类能力。介绍了系统架构、构建演进、知识体系、质量评估等内容,还展示实战成效,指出当前边界与下一步方向。
GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!
GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。
Win版Claude Cowork杀疯了!140元雇个全职AI员工,全网首测真香
昆仑万维推出天工Skywork桌面版,专为Windows打造,能调用Claude和Gemini。实测显示,它可高效分类文件夹、提取图片、生成报告等。相比Claude Cowork,其在生态、视觉、模型等方面有优势,还降低了办公门槛。
AI 硬件新物种:七位从业者对消费级 AI 硬件的答案
2026 年 CES 落幕,释放中国 AI 硬件集体出海信号。蚂蚁集团等主办的活动上,7 位从业者分享消费级 AI 硬件产品,涵盖养成宠物、智能戒指等。他们认为 AI 硬件竞争焦点正从模型能力转向场景理解。
马斯克首席AI脑与莱姆病抗争!曾师从丘成桐,杨格宣布辞职
马斯克xAI核心架构师、联创之一杨格宣布离职,转任非正式顾问。他长期与莱姆病斗争,打算康复后复出。杨格是数学天才,师从丘成桐,是Tensor Programs理论之父,其技术为xAI节省大量算力成本。