ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Open Generative AI 实践指南:400+ 模型的自托管 AI 图像与视频生成工作室

Open Generative AI 实践指南:400+ 模型的自托管 AI 图像与视频生成工作室 Open Generative AI 实践指南400 模型的自托管 AI 图像与视频生成工作室【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image video generation studio with 600 models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AIOpen Generative AI 是一个 MIT 协议的开源 AI 图像与视频生成工作室它把 Flux、Midjourney、Kling、Sora、Veo 等 400 多个模型收进同一套界面里没有内容过滤也没有订阅费。你既可以把它部署在自己的服务器上也能通过桌面应用在本机跑 SD 1.5、Z-Image 这类本地模型。它适合想脱离平台订阅和提示词审核、有基础 Node.js 环境的开发者和创作者。我核对了 models.js 的模型清单实际定义的模型条目是 440 个覆盖文生图、图生图、文生视频、图生视频、视频转视频、对口型、重铸、音频八个类别。 从克隆仓库到第一次生成最短路径是什么结论先说两条路一条给普通用户下桌面安装包一条给想改代码的人源码启动。桌面应用从 Releases 下载 v1.0.9 的安装包macOS 的 .dmg、Windows 的 .exe、Linux 的 .AppImage/.deb全程不需要 Node.js。macOS 未做公证首次启动需要在终端执行一次xattr -cr /Applications/Open Generative AI.app再右键打开Ubuntu 24.04 用 .deb 更省事它自带 AppArmor 配置。源码启动需要 Node.js 18 和一个 MuAPI 访问密钥只用于云端模型纯本地推理可以跳过密钥。git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run dev # Web 版访问 http://localhost:3000 npm run electron:dev # 桌面版注意npm run setup不能省略成npm install它还会构建packages/studio、Vibe-Workflow、agents 等四个工作区包漏掉这步开发脚本跑不起来。如果启动时报Couldnt find a pages directory说明你不在仓库根目录或子模块没拉全——README 里有对应排查说明。启动后界面是一个选项卡导航挂着 14 个工作室Image、Video、Audio、Clipping、Vibe Motion、Lip Sync、Recast、Cinema、Marketing、Workflow、Agent、Design Agent、Apps、AI Influencer。生成结果会进入本地历史记录刷新页面时未完成的轮询任务会自动恢复。️ 能力地图按你想做什么找功能不按模块罗列按场景说每个场景给出入口、效果和限制。快速出概念图Image Studio 是双模式的——不传图时走文生图72 个模型上传参考图后自动切到图生图75 个模型。选到支持多图的模型如 Nano Banana 2 Edit时上传器会变成多选模式图片按你勾选的顺序编号发送。限制每个模型的宽高比、分辨率选项不一样UI 里的选项是动态适配的不能假设所有模型都支持 4K。让静态图动起来Video Studio 同样是双模式60 秒内的短视频用图生视频132 个模型就够了纯文字脑暴用文生视频90 个模型。Seedance 2.0 系列支持 5/10/15 秒时长和 basic/high 两档质量Grok Imagine 提供 fun/normal/spicy 三种模式。本地侧Wan 2.2、Hunyuan、LTX 这些视频模型只在 Wan2GP 引擎里可用且消费级 GPU 上速度很慢。给角色配音对口型Lip Sync Studio 有 15 个模型、两种输入。肖像图 音频走 Infinite Talk、Wan 2.2 Speech、LTX Lipsync 这类图像模式模型输出 480p–1080p 的说话视频已有视频 音频则走 Sync、LatentSync、Veed 等视频模式模型。限制视频模式的部分模型没有分辨率选项输出规格由上游决定。批量产出内容Workflow Studio 提供节点式拖拽编辑器、模板库、社区工作流和 Playground 试运行每条工作流也可以通过 API 执行Agent Studio 则是多轮对话式的任务代理。这两个入口适合把生成 → 编辑 → 再处理串成固定流水线省去手工重复操作。调出电影感Cinema Studio 把相机、镜头、焦距、光圈翻译成提示词修饰。可选 8mm 超广角到 85mm 长焦、f/1.4 浅景深到 f/11 深焦以及 16mm 胶片、变形镜头等镜头类型——本质是结构化的 prompt 工程不是独立的渲染管线。 场景走查一次多参考图融合编辑怎么发生挑最能体现这个项目差异化的场景把多张参考图喂给编辑模型产出一张融合后的新图。输入在 Image Studio 上传参考图。Nano Banana 2 Edit 最多收 14 张Flux Kontext Dev、GPT-4o Edit 等收 10 张Vidu Q2 收 7 张。选中多图模型后上传按钮变为多选带顺序徽章批量勾选后点 Use Selected 确认。关键参数模型名、images_list有序数组、prompt、分辨率1K/2K/4K、宽高比支持auto。走底层 API 时是标准的提交 轮询两步密钥放x-api-key头const r await fetch(https://api.muapi.ai/api/v1/nano-banana-2-edit, { method: POST, headers: { Content-Type: application/json, x-api-key: KEY }, body: JSON.stringify({ prompt: 融合三张参考图保留人物面部换成 1950 年代波点裙, images_list: [url-1, url-2, url-3], resolution: 2K }) }); const { request_id } await r.json(); const result await fetch( https://api.muapi.ai/api/v1/predictions/${request_id}/result, { headers: { x-api-key: KEY } } );自托管时这两个请求会先打到你的 Next.js 服务/api/*路由转发到上游浏览器不需要处理跨域Electron 的 file:// 环境则直连上游。这个提交拿 request_id、轮询到 completed的模式对所有模型通用muapi.js 里submitAndPoll是统一实现。输出与调优结果是全分辨率的可下载图片。三个实用建议其一多图模型的输出质量强烈依赖图片顺序把要保留的主体放第一张其二prompt 里明确写保留什么、替换什么比堆形容词有效其三2K 以上分辨率出图慢且更贵按次计费先 1K 试参数满意了再升档。⚖️ 选型与避坑本地、云端和硬件门槛三个推理通道先分清云端 APIWeb 版默认模型最全、sd.cpp桌面应用内置仅图像、Wan2GP自带 GPU 服务器图像 视频。维度云端 APIsd.cpp本机Wan2GP自架服务器模型范围全部 440 个6 个图像模型Flux、Qwen-Image、Wan 2.2、Hunyuan、LTX硬件要求无Metal/CUDA/Vulkan/ROCm服务器需 NVIDIA/AMD GPUMac 支持✅✅Metal 加速应用端可以推理端不行无 MPS 路径费用按次计费免费免费电费另算内容过滤无无无8GB 内存能跑通吗能但只限 SD 1.5。README 明确警告8GB 的 M 系列 Mac 跑 Z-Image 会卡死整个系统它的权重加计算缓冲需要约 10GB7.4GB 权重 2.4GB buffer建议 16GB 起步。M2 上 SD 1.5 正常约 1–2 秒/步如果你看到 10 秒/步多半是引擎回退到了 CPU用otool -L检查 dylib 是否链了 Metal 即可定位。Wan2GP 为什么非要独立服务器它的运行时Sage attention、flash-attn、AWQ/GGUF 内核是 CUDA 生态的没有 Apple Silicon 路径所以架构上把它设计成远程 Gradio 服务桌面端只发 prompt、收结果推理扔给局域网游戏主机或租的 GPU 实例。# 在你的 GPU 机器上 cd Wan2GP ./install.sh python wgp.py --listen --server-name 0.0.0.0然后在桌面应用 Settings → Local Models 里填 URL点 Test 再 Save。什么情况下别用这个项目如果你只是偶尔出几张图、不想碰终端用官方托管的 Web 版注册即用、模型始终最新比自托管省事得多如果你需要开箱即用的本地视频生成目前没有一站式方案——本地视频必须自己架 Wan2GP且消费级显卡上耗时可观。下一步去哪里这个项目适合三类人受够了订阅费和提示词审核的内容创作者、想自建 AI 生成服务的技术团队、以及想基于 packages/studio 这套组件库二次开发的人——模型清单是单一数据源改一处自托管版和托管版同时生效。入门材料都写在 README.md 里包括各平台安装包的踩坑记录和sd-cli的本地验证方法想加自己的模型直接从 models.js 的现有条目照抄格式入手即可。【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image video generation studio with 600 models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表