「端到端技术」共找到 4683 篇相关文章
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM多任务处理潜力,为自动驾驶等领域带来前景。
爆火的AI三宫格图片,比我们的生活更像电影。
最近三宫格AI图片爆火,起初是唯美电影感写真配文艺台词,后各地文旅、宠物赛道等画风渐趋抽象。其制作简单,用豆包的Seedream 4.0即可,文中还给出Prompt模板,该现象内核是将生活电影化。
全球仅9所,清华姚班校友当选!亚马逊AI博士奖学金豪掷6800万美元
亚马逊官宣AI博士奖学金,两年共6800万美金,为全球九所顶尖大学100多名博士生提供支持,资助智能体系统等硬核方向。目前,MIT、CMU、UC伯克利公布获奖名单,多位华人学者入选。
Claude Skills,4000字详解 Anthropic 的思考
Anthropic推出新技能Claude Skills,作者认为它会引导第三方工具形态。Skills结合笔记式形态、可执行工具与AI调度自优化,具备低门槛、灵活表达等优势,还实现了AI自我进化,是一种新范式。
Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡上
DeepSeek发布新模型DeepSeek - OCR,有诸多技术贡献,获Karpathy等盛赞。它或让文本token输入方式被淘汰。开发者Simon用Claude Code让其在N卡上运行成功,分享了详细过程与经验。
瑞能半导体王越:汽车发展浪潮中,国产SiC器件机遇何在?
瑞能半导体王越在大会演讲,剖析碳化硅器件汽车应用前景,介绍瑞能车规级SiC产品布局。电动汽车电气架构集成化、电压平台高压化,为SiC器件带来机遇,瑞能技术积累深厚,产品布局全面。
Sora2不够香了!这款国产AI视频模型已经能边看边生成,生成快还互动佳
国内AI视频玩家弯道超车,百度蒸汽机(文心专精版)开卷实时流式生成。它能边看边生成,生成快还互动佳,实现生成迅速、实时交互、无限续写,重新定义AI视频生成领域。
NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则
文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。
Cursor 1.7 新增 Agent 生命周期管控钩子函数
Cursor 1.7 版本推出钩子系统,可在预定义生命周期节点拦截并修改 Agent 行为,如阻断命令、自动运行工具等。早期反馈有好有坏,虽有团队探索集成,但应用范围有限,还存在文档缺失等问题。
刚刚,OpenAI最强DevDay剧透!奥特曼发神秘预告,Jony Ive压轴登场
OpenAI DevDay即将开幕,奥特曼发文称有新东西助力AI开发。本届大会或成其在硅谷扩张宣言,将推出Agent Builder,或发布ChatGPT浏览器,还聚焦企业级AI应用,展示新兴技术体验区。