多模态文生图应用
多模态文生图应用1. 概念介绍1.1 什么是文生图(Text-to-Image)?****核心原理1.2 什么是 FastSDCPU?核心特点适用场景2.项目部署2.1部署环境2.2局域网访问2.3使用文生图功能2.4 部署成功后启动方法
由于ollama不支持文生图的功能,我们需要借助其他工具来实现本地文生图功能。
1. 概念介绍
1.1 什么是文生图(Text-to-Image)?
文生图是一种通过文字描述 自动生成对应图像的人工智能技术。只需输入一段文字(例如“一只戴着墨镜的柴犬在沙滩上冲浪”),AI 模型就会根据语义理解生成符合描述的图片,无需任何绘画或设计基础。
核心原理
- 语言理解 :AI 先解析你的文字,识别关键词(如“柴犬”“墨镜”“沙滩”)。
- 图像生成 :基于海量图像数据训练,AI 将文字转化为视觉元素,并组合成合理的画面。
- 风格适配 :可指定风格(写实、卡通、水彩等),AI 会调整生成效果。
1.2 什么是 FastSDCPU?
FastSDCPU 是一个专为 CPU 设备优化 的 Stable Diffusion 文生图 开源项目。它通过算法与工程优化,实现在无 GPU 的普通计算机上快速生成高质量图像,显著降低 AI 绘画的硬件门槛。
核心特点
- 纯 CPU 运行 :无需独立显卡,可在笔记本、台式机或边缘设备上直接运行。
- 高速推理 :结合 Latent Consistency Models(LCM)等技术,仅需 4–8 步即可生成图像,大幅缩短等待时间。
- 轻量化部署 :支持模型量化(如 INT8)与 OpenVINO 加速,减少资源占用,提升响应效率。
适用场景
- 本地化 AI 创作工具
- 企业内网图像生成服务
- 教学演示与原型开发
- 资源受限环境下的轻量级部署
2.项目部署
2.1部署环境
注:若是使用我们的出厂镜像,无需部署环境,直接跳过部署步骤。直接参考最下面的 <2.4部署成功后启动方法> ,直接启动即可。
打开一个终端,然后执行以下代码:
x #如果主板上没有git,就先运行 sudo apt update sudo apt install git -y sudo apt install python3.10-venv -y #添加环境变量 echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc source ~/.bashrc # 克隆项目代码 git clone https://github.com/rupeshs/fastsdcpu.git cd fastsdcpu # 创建虚拟环境并安装依赖 python -m venv venv source venv/bin/activate #安装uv curl -Ls https://astral.sh/uv/install.sh | sh(这一步如果在中国没有挂代理可能会无法成功,如果不超过可以跳过这一步,执行下一条命令) #上一步使用curl命令安装uv不成功的就运行这三条指令 wget https://mirrors.huaweicloud.com/astral/uv/0.8.4/uv-aarch64-unknown-linux-gnu -O ~/.local/bin/uv chmod +x ~/.local/bin/uv ~/.local/bin/uv --version chmod +x install.sh start-webui.sh ./install.sh --disable-gui
安装成功,按任意键退出:

2.2局域网访问
启动之前,需要修改一个文件,用于支持局域网的访问,否则只能本地访问webui:
xxxxxxxxxx vim ~/fastsdcpu/src/frontend/webui/ui.py
打开 ui.py 文件之后,翻到最后一行,找到 webui.launch(share=share) 这句代码,修改成 webui.launch(server_name="0.0.0.0",share=share)
然后保存
启动:
xxxxxxxxxx ./start-webui.sh

然后就可以在浏览器上面输入你的主板IP:7860 来访问这个webui了。
2.3使用文生图功能
在终端使用ifconfig查询我们主板的ip,例如我的是192.168.2.106。
然后我们就打开浏览器,输入 你的主板ip:7860 。例如我,就输入192.168.2.106:7860,然后就能进入webui了。

接着我们点击LCM-LoRA,这个模型对内存的占用比较小,如果想使用其他模型,可以自行研究。
然后再点击Models,可以看到LCM LoRA的模型设置,可以自己更改自己想要的模型,也可以和我一样选择默认的就可以了。

接着点击Generation Settings,将里面的Inference Steps拉高,可以提高生成图片的质量,我这里拉到5.

接着继续回到我们的Text to Image中,在对话框里输入我们想生成的内容,接着按Generate,就可以开始生成图片了。

首次使用的话,需要下载模型,可以在终端看到刚才默认选择的模型正在被下载中,等它下载完毕之后,就会开始执行文生图的功能。

生成的结果:

实测本项目对英文的支持会更好,生成的图片会更贴合文字。建议使用英文描述来生成图片。
2.4 部署成功后启动方法
xxxxxxxxxx cd fastsdcpu #进入fastsdcpu的目录 source venv/bin/activate #进入虚拟环境 ./start-webui.sh #启动webui
webui启动成功后,就在浏览器上输入你的主板IP:7860,就可以开始文生图功能了。