「端到端架构」共找到 3885 篇相关文章
Google 发了个压缩算法,内存砍 6 倍,速度快 8 倍,精度零损失
Google Research发布TurboQuant压缩算法,将在下月ICLR 2026正式发表。该算法把大模型的KV Cache压缩到3 bit,内存降6倍、速度快8倍且精度零损失,解决了传统算法的压缩开销问题。
Vibe Coding 有了,Vibe Design 呢?Lovart 让不会设计的人也能输出专业素材
作者用 AI 编程一年多,但标签页表情包提醒自己不是设计师。现有生图工具生成的 PNG 不能直接当 logo 用,而 Lovart 打通从 PNG 到 SVG 的路,让无设计知识的人也能输出专业素材。
Cursor 套壳、Cloudflare 上架、老黄邀请,中国模型杀进了硅谷的 AI 供应链
3月19日,Cursor发布新模型Composer 2,后被发现底层基于中国Kimi开源模型K2.5微调。此外,Cloudflare将K2.5上架到边缘计算平台,成本降77%;黄仁勋邀Kimi创始人演讲;马斯克两度点赞Kimi。
arXiv变天:将脱离康奈尔大学独立,招聘CEO,网友:以后还能白嫖吗?
arXiv发布官方信息,将脱离康奈尔大学转型为独立非营利组织,还发布CEO招聘公告。它始建于1991年,在康奈尔经历从个人项目到机构基础设施的转型,现面临AI投稿井喷、审核困境和技术债务等挑战。
2026国内 OpenClaw 完整指南!12个平台一站式汇总,零代码养龙虾再也不是梦!!
腾讯举办OpenClaw小龙虾免费安装活动,让更多人意识到其时代已至。国内各大厂和云平台推出一站式封装平台,解决安装难题。文章汇总扣子Coze、腾讯QClaw等12个平台,介绍特点、适合人群等。
让问题不过夜:交易领域“问诊”Agent实践
文章针对研发支持中的痛点,构建智能Agent系统,将问题抽象为业务答疑与问题诊断两类能力。介绍了系统架构、构建演进、知识体系、质量评估等内容,还展示实战成效,指出当前边界与下一步方向。
阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了
阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。
GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!
GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。
蚂蚁集团扩散大语言模型新突破:超800Token/s,速度与质量兼得
蚂蚁集团将LLaDA更新到2.1,通过引入“草稿 - 编辑”机制,打破扩散模型推理速度与质量的对立僵局。它有极速和质量两种模式,还采用混合训练流程及强化学习,在多基准测试中表现出色。
Anthropic员工效率碾压谷歌1000倍!打工人想进,必须先「杀死自我」
新智元报道,一位硅谷老兵与Anthropic近40人深聊后揭示其成功公式,即工作量碾压人数能带来创新井喷。Anthropic无部门壁垒,产品10天可从想法到上线,员工效率远超谷歌,2026年或击垮大量企业。