「视觉 - 语言数据」共找到 3799 篇相关文章
The Batch:833 | 针对智能体的钓鱼攻击
研究人员发现误导基于大语言模型的自主智能体的方法,即通过在热门网站植入恶意链接,利用智能体对热门网站的‘隐性信任’攻击。测试显示智能体易受诱导执行有害行为。
时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8
在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在多任务中表现出色,代码已开源。
AI 能耗救星!这个能倒着走的「可逆计算」芯片,将能耗直降10倍
最新研究提出可逆芯片,通过让计算「倒着走」,有望将AI能耗直降10倍。它基于热力学原理,避免删除数据以减少热量产生。经几十年探索,如今可逆计算或成延续计算进步关键。
DeepSeek接入智慧小浪,「评论罗伯特」爆梗进化!背后大模型全揭秘
新浪新闻推出AI辅助工具「智慧小浪」,接入DeepSeek深度思考能力,依托知微大模型,能总结资讯要点、提供延伸阅读。微博「评论罗伯特」升级,更懂用户情绪、回复有深度。此外,微博还有博主AI助手等爆款应用。
微软开源AI量化投资神器,狂揽23.5K星标,一站式打造你的智能交易系统!
量化投资结合AI成金融新趋势,但构建完整量化流程难题多。微软开源的Qlib平台是领军者,基于Python覆盖全流程,支持30+模型,数据引擎快,功能亮点多,安装方式多样。
OpenAI未公开的o3「用图思考」技术,被小红书、西安交大尝试实现了
OpenAI推出的o3推理模型打破传统文字思维链边界,实现图像融入推理过程。小红书与西安交大联合构建多模态深度思考模型DeepEyes,尝试实现类似能力,还开源技术细节,在多任务中表现出色。
o3崛起,但推理模型离「撞墙」只剩一年?
OpenAI的o3推理模型诞生不到一年能力突飞猛进,算力暴增10倍。但Epoch AI等警告,最多一年推理模型或撞上算力资源极限。还从其他模型和业内人士看法分析推理算力,指出算力与性能有关联,也有发展瓶颈。
大模型推理的“左右脑”革命!华为盘古Embedded凭昇腾之力,让快慢思考合二为一
传统大模型推理面临长链条深度思考与低时延反馈的矛盾,华为盘古团队提出盘古Embedded模型。基于昇腾NPU,其采用双系统认知架构,集成“快思考”与“慢思考”双推理模式,实现推理效率与精度协同提升。
具身进化·无界未来:这场论坛引领具身智能模型革命新浪潮
5月29日,2025张江具身智能开发者大会相关论坛举行,汇聚专家探讨热点话题。张江集团推动产业发展,多位嘉宾分享成果与思考,圆桌对话也各抒观点,为具身智能发展描绘蓝图。
200行python代码实现从Bigram模型到LLM
本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。