「零成本智能」共找到 4942 篇相关文章
ICCV 2025 | FDAM:告别模糊视界,源自电路理论的即插即用方法让视觉Transformer重获高清细节
针对视觉 Transformer(ViT)‘低通滤波’特性致细节丢失问题,北京理工大学等团队提出即插即用的 FDAM 模块。它受电路理论启发,能提升模型在分割、检测等任务性能,取得 SOTA 效果,有巨大应用潜力。
阿里发布Qwen3-TTS:跨语言混合无缝切换,方言音色全面覆盖!
TTS技术从单一合成进化到多模态表达,但传统模型在跨语言/方言混合场景有不足,商业工具费用高且不开源,开源方案训练数据少。阿里推出Qwen3 - TTS,实现人类级自然度和表现力,功能强大,应用场景多。
万象入模 风起琶洲 | 甲子光年
9月23日下午,「第四届琶洲算法大赛大模型前沿技术分论坛暨琶洲模方孵化项目展示」将在广州琶洲举行。届时,亚洲科学院院士等将分享见解,知名投资机构将齐聚,还有企业展示成果、进行辩论,共探AI产业未来。
狂肝一周,测评十余款 PPT AI 生成产品的真实反馈
评估 Agent 产品能力复杂,以 PPT 生成为例,有 Agent 和模板化两种流派。作者选前者投票测评、后者全方位测试。给出方案,还推荐不同需求适用产品,附总榜单和细致体验描述。
Github 斩获 16.3k star,Open Lovable 只需1分钟,就能克隆你的任意网站!
Open Lovable 是 Firecrawl 团队开源项目,能通过 AI 聊天将任意网站转化为 React 应用,支持整站抓取与重组。它解决了多类人群痛点,功能丰富,技术架构有优势,在同类对比中表现出色,获 16.3k star。
腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容
腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型。
Claude Sonnet 4 API 支持百万上下文:解锁真正的生产级AI工程
Anthropic宣布Claude Sonnet 4支持100万Token上下文窗口,容量是之前5倍。长上下文支持已向部分客户公测,将推给更多用户。该功能已在亚马逊Bedrock公测,也将登陆Google Cloud。还介绍了用例、定价及早期用户好评。
一个人,40 款应用、百万级用户,验证 MVP 这事,没那么复杂
AI独立开发者Hassan El Mghari 4年开发40多款AI应用,部分达百万级用户量。他分享开发全流程经验,指出开发者常犯发布慢、过度复杂化问题,强调用低成本验证MVP,从多渠道找需求。
科学能力太强,这个多模态推理「六边形战士」被严重低估!Intern-S1开源登顶
7月26日,上海AI实验室发布并开源「书生」科学多模态大模型Intern-S1,其多模态能力全球开源第一,文本能力比肩一流,科学能力国际领先。它开创「通专融合」新范式,重构科研生产力,引发国际关注。
西工大张伟伟团队:大模型时代航空科技的蓝图畅想 | 航空学报CJA
随着国产开源大模型涌现,大语言模型走入生活,挑战传统航空教育,革新科研范式,与航空产业融合推动变革。西工大张伟伟团队探讨其在航空工程教育、科研、行业全链条的影响及挑战。