LLM式视觉编码器」共找到 1611 篇相关文章

开源动态8

AI编程Token消耗降低神器:RTK(Rust Token Killer)实战指南

文章介绍RTK(Rust Token Killer),它能在CLI命令输出到LLM上下文前智能过滤压缩,节省60 - 90%Token。文中说明了其原理、特性、压缩策略,还给出安装配置步骤、实测数据及使用建议。

机器学习AI算法工程
新闻资讯7

The Batch: 941|盲人辅助模型中的隐患

视障患者用AI评估外貌引发关注。失明记者Milagros Costabel撰文探讨用视觉语言模型作“虚拟镜子”的挑战与隐患,如AI会给出评判性反馈,心理学家担心这加剧抑郁焦虑。产品应提供客观解读。

DeeplearningAI
产品应用7

Karpathy又双叒叕发新概念了,这次我替你找到了那个产品

Andrej Karpathy提出将LLM算力用于建知识库,引发关注但搭建有门槛。网易有道新出的有道宝库功能类似,能自动理解整理资料,有追问、多模态输出等功能,还打通翻译链路,目前免费内测。

花叔
开源动态8

登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界

全球科技界正豪赌「世界模型」,但主流模型多停留在「视觉生成」。中国影溯公司发布并开源世界模型 InSpatio - World,综合性能优异,以小博大登顶权威榜单,降低了物理世界数字化门槛,引发行业关注。

机器之心
产品应用8

2秒终结AI 3D不可能三角,我们和VAST首席科学家曹炎培聊了聊

速度、质量、管线可用性是AI 3D生成的不可能三角。VAST发布的Tripo P1.0首次在原生三维空间概率生成,2秒输出专业3D资产,效率提升百倍,生成结果可直接用于多场景,突破了这一困境。

机器之心
推荐文章8

从“暴力烧Token”到“系统工程”:OpenAI与华为的两条 AI 编程路径

文章对比OpenAI与华为的AI编程路径,指出模型中心派靠推高上下文窗口但有成本高、延迟大等问题;工具驱动派如Cursor和华为云码道重构IDE工具。码道将任务解耦,通过多技术实现性价比,还介绍了底层基石及其实测表现。

InfoQ
算法论文8

代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈

ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。

新智元
产品应用8

AI如何成为企业的“数字员工”?中关村科金的超级连接答案 | 甲子光年

中关村科金在EVOLVE 2025峰会上,系统回答AI成企业“数字员工”问题。针对落地困境,提出多方案;发布得助智能客户平台5.0等,实现多方面连接;强调务实态度,助力企业智能化升级。

甲子光年
产品应用8

安卓党狂喜!Open-AutoGLM让手机自己订外卖、抢票、刷小红书

Open - AutoGLM是能让手机自己干活的黑科技,给手机装了「AI打工人」。它整合视觉语言模型与ADB远程操控技术,适配50 + 款主流应用,自带安全边界,普通人易安装,开发者可自定义流程。

CourseAI
算法论文8

解决Agent幻觉:HaluMem精准定位记忆系统的“说谎”环节!

近年来,LLM和Agent在记忆管理上存在挑战,现有评估方法无法定位幻觉来源。论文提出HaluMem评估基准,通过三大任务和两个数据集揭示记忆系统幻觉行为,为开发可靠记忆机制提供指导。

深度学习自然语言处理