Skip to main content

示例运行

1. 前置条件

语音交互功能需搭配 USB 音频输入与输出设备使用。

2. 模型体验

SDK 提供以下 AI 能力,均可通过一键编译生成可运行的应用程序。详细说明请参阅 04-AI与算法

类别能力组件路径详细文档
语音ASR 语音识别components/model_zoo/asr4.1.1-ASR
TTS 语音合成components/model_zoo/tts4.1.2-TTS
VAD 语音活动检测components/model_zoo/vad4.1.3-VAD
声纹识别components/model_zoo/voiceprint4.1.4-声纹
视觉目标检测components/model_zoo/vision4.2.1-目标检测
实例分割components/model_zoo/vision4.2.2-实例分割
人体姿态components/model_zoo/vision4.2.3-人体姿态
人脸检测components/model_zoo/vision4.2.4-人脸检测
手势识别components/model_zoo/vision4.2.5-手势识别
图像分类components/model_zoo/vision4.2.6-图像分类
表情与情绪识别components/model_zoo/vision4.2.7-表情与情绪识别
行为识别components/model_zoo/vision4.2.8-行为识别
多目标跟踪components/model_zoo/vision4.2.9-多目标跟踪
人脸识别components/model_zoo/vision4.2.10-人脸识别
LLM大语言模型components/model_zoo/llm4.4-LLM
VLM视觉语言模型components/model_zoo/vlm4.6-VLM
Agent智能体application/native/omni_agent4.5-Agent

以下以视觉目标检测为例,演示编译与运行流程。

2.1 一键编译

cd components/model_zoo/vision
mm

2.2 快速运行

下载模型资源:

bash examples/yolov8/scripts/download_models.sh

bash scripts/download_assets.sh

运行检测:

yolov8 examples/yolov8/config/yolov8.yaml

(可选)使用摄像头进行实时检测:

yolov8 examples/yolov8/config/yolov8.yaml --use-camera --camera-id 0 # 请确认摄像头 ID

3. 语音交互

本节以 Omni Agent 为例,演示语音交互功能的编译与运行。

3.1 一键编译

cd 项目根目录
lunch

选择目标方案:

You're building on Linux

Lunch menu... pick a combo:

1 k1-muse-pipro-minimal
2 k3-com260-kit-humanoid-asimov
3 k3-com260-kit-humanoid-qinglong
4 k3-com260-kit-humanoid-tiangong
5 k3-com260-kit-humanoid-tinker
6 k3-com260-kit-humanoid-unitree-g1
7 k3-com260-kit-humanoid-unitree-go1
8 k3-com260-kit-humanoid-unitree-h1_2
9 k3-com260-kit-humanoid-unitree-r1
10 k3-com260-linksee
11 k3-com260-minimal
12 k3-com260-reachy-mini
13 kx-generic-omni_agent

选择 kx-generic-omni_agent,执行编译:

m # 一键编译

3.2 快速运行

下载模型资源:

mkdir -p ~/.cache/models/llm
cd ~/.cache/models/llm
# 示例下载qwen2.5 0.5b的模型
wget https://archive.spacemit.com/spacemit-ai/model_zoo/llm/qwen2.5-0.5b-instruct-q4_0.gguf

启动 LLM 服务:

llama-server -m ~/.cache/models/llm/qwen2.5-0.5b-instruct-q4_0.gguf -t 8 --port 8080

启动语音对话:

voice_chat --llm-url http://localhost:8080 --model qwen2.5:7b --tts matcha:zh-en