aclopCreateHandleForCast
aclblasCreateHandleForS8gemm
函数功能
创建矩阵-矩阵乘的handle,输入数据的数据类型为int8_t,输出数据的数据类型为int32_t,同步接口。
创建handle成功后,需调用aclopExecWithHandle接口执行算子。
函数原型
aclError aclblasCreateHandleForS8gemm(****aclTransType transA,
aclTransType transB,
aclTransType transC,
int m,
int n,
int k,
aclComputeType type,
aclopHandle **handle)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| transA | 输入 | A矩阵是否转置的标记。 |
| transB | 输入 | B矩阵是否转置的标记。 |
| transC | 输入 | C矩阵的标记,当前仅支持ACL_TRANS_N。 |
| m | 输入 | 矩阵A的行数与矩阵C的行数。 |
| n | 输入 | 矩阵B的列数与矩阵C的列数。 |
| k | 输入 | 矩阵A的列数与矩阵B的行数。 |
| type | 输入 | 计算精度,默认高精度。 |
| handle | 输出 | “算子执行handle的指针”的指针。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: CBLAS接口
aclopCast
函数功能
转换输入数据的数据类型,异步接口。
函数原型
aclError aclopCast(const aclTensorDesc *srcDesc,
const aclDataBuffer *srcBuffer,
const aclTensorDesc *dstDesc,
aclDataBuffer *dstBuffer,
uint8_t truncate,
aclrtStream stream)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| srcDesc | 输入 | 输入tensor描述的指针。 |
| srcBuffer | 输入 | 输入tensor的指针。 |
| dstDesc | 输入 | 输出tensor描述的指针。 |
| dstBuffer | 输出 | 输出tensor的指针。 |
| truncate | 输入 | 预留。 |
| stream | 输入 | 执行算子所在的Stream。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: CBLAS接口
aclopCreateHandleForCast
函数功能
创建数据类型转换的handle,同步接口。
创建handle成功后,需调用aclopExecWithHandle接口执行算子。
函数原型
aclError aclopCreateHandleForCast(****aclTensorDesc *srcDesc,
aclTensorDesc *dstDesc,
uint8_t truncate,
aclopHandle **handle)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| srcDesc | 输入 | 输入tensor描述的指针。 |
| dstDesc | 输入 | 输出tensor描述的指针。 |
| truncate | 输入 | 预留。 |
| handle | 输出 | “算子执行handle的指针”的指针。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: CBLAS接口
总体说明
多版本接口差异
- 本手册中媒体数据处理V1版本与媒体数据处理V2版本的接口都是描述处理媒体数据的接口,用于实现视频编解码、图像编解码、图像处理等功能,但两套接口不能混用。
- V2版本的功能比V1版本更多,如下:
- JPEGE:V2版本接口支持高级的参数配置,如huffman表配置。
- VENC:V2版本接口支持更加细化的码控参数配置和效果调优,如I/P帧QP、宏块码控等。
- VDEC:V2版本接口支持更细化的内存控制,如设置输入码流缓存。
- 视频数据获取功能(ISP系统控制&MIPI命令字&VI功能):仅V2版本接口支持。
- VPSS视频处理:仅V2版本接口支持。
- 音频相关功能,包括录音、播音、音量调节:仅V2版本接口支持。
- 视频数据展示功能(VO功能&HDMI外设):仅V2版本接口支持。
- 建议使用V2版本中的接口,保证后续版本接口功能以及业务的连续演进。
- V1版本中的接口是为了兼容旧版本,保证使用该部分接口的用户能继续使用,后续版本不再演进。
- V2版本的功能比V1版本更多,如下:
功能说明
本章节介绍媒体数据处理V1版本(DVPP,Digital Vision Pre-Processing)的功能,如表1所示。
表1 功能说明
| 功能 | 功能 |
|---|---|
| VPC(Vision Preprocessing Core) | 负责图像处理功能,支持对图片做抠图、缩放、格式转换等操作,详细描述请参见约束说明。 |
| JPEGD(JPEG Decoder) | 负责完成图像解码功能,将.jpg、.jpeg、.JPG、.JPEG图片解码成YUV格式图片,详细描述请参见功能及约束说明。 |
| JPEGE(JPEG Encoder) | 负责完成图像编码功能,将YUV格式图片编码成.jpg图片,详细描述请参见功能及约束说明。 |
| VDEC(Video Decoder) | 负责视频解码,详细描述请参见功能及约束说明。 |
| VENC(Video Encoder) | 负责视频编码,详细描述请参见功能及约束说明。 |
| PNGD(PNG decoder) | 负责PNG格式图片的解码,详细描述请参见功能及约束说明。 |
功能支持度说明
昇腾AI处理器对媒体数据处理V1版本各功能的支持度如表2所示。
表2 功能支持度说明
| 昇腾AI处理器 | VPC | JPEGD | JPEGE | PNGD | VDEC | VENC |
|---|---|---|---|---|---|---|
| Atlas 200/500 A2推理产品 | √ | √ | √ | √ | √ | √ |
整体约束说明
使用本章中介绍的接口,有以下注意点:
-
关于异步接口:
对于本章介绍的异步接口,调用接口成功仅表示任务下发成功,不表示任务执行成功,对于有依赖的接口,为确保能按序执行任务,建议用户在多个接口中指定同一个stream,因为同一个stream中的任务按接口调用顺序执行。
在调用异步口对图片进行解码、抠图、缩放等操作时,如果任务之间有依赖,一定要调用aclrtSynchronizeStream接口确保在同一个Stream中的任务按序执行。
从性能角度考虑,建议一个stream上下发多个异步媒体数据处理任务后,执行一次aclrtSynchronizeStream接口。
调用异步接口后,不能马上释放资源,需调用同步等待接口(例如,aclrtSynchronizeStream)确保Device侧任务执行完成后才能释放。
-
关于内存申请/释放:
- 实现媒体数据处理的VPC、JPEGD、JPEGE等功能前,若需要申请Device上的内存存放输入或输出数据,需调用acldvppMalloc申请内存、调用acldvppFree接口释放内存。如果多个功能串联使用的场景,需要复用同一段内存,则按最大内存要求来申请内存。
- 调用1申请出来的内存可以满足媒体数据处理的要求,也可以在其它任务中使用,例如,从性能角度,为了减少拷贝,媒体数据处理的输出作为模型推理的输入,实现内存复用。
- 但由于媒体数据处理访问的地址空间有限,为确保媒体数据处理时内存足够,除媒体数据处理功能外的其它功能(例如,模型加载),建议调用内存管理章节下的aclrtMalloc接口、或aclrtMallocHost接口、或aclrtMallocCached接口申请内存。
-
关于通道的要求:
实现媒体数据处理的各功能前,必须调用接口创建对应功能的通道,创建通道的接口请参见通道创建与释放。通道的创建与销毁会涉及资源的申请与释放,反复创建与销毁通道会影响业务性能,因此建议根据实际场景管理通道,例如,如果有持续VPC图片处理,则创建VPC的通道后,等到所有VPC功能调用完成后,再销毁该VPC通道。
通道数量多,会影响Device的CPU占用率和内存占用,通道数量建议参考各功能章节下的的性能指标的路数。
Atlas 200/500 A2推理产品上,各功能的通道数有一定的限制,VPC的通道数最多128,JPEGD的通道数最多128,VDEC的通道数最多128,JPEGE的通道数最多128,VENC的通道数最多128,PNGD的通道数最多128。创建通道的接口请参见通道创建与释放。
:::note 说明 **对于Atlas 200/500 A2推理产品,**昇腾虚拟化实例(Ascend Virtual Instance)场景下,如果通道总数不为整数,则向下取整:
- VPC通道总数最多128。
- VDEC通道 = ( 被分配的VDEC硬件单元 / VDEC硬件单元 ) * 128,如果通道总数不为整数,则向下取整。JPEGD的通道数不随算力影响,但JPEGD+VDEC的总通道数最大128。
- VENC通道 = ( 被分配的VENC硬件单元 / VENC硬件单元 ) * 128,如果通道总数不为整数,则向下取整。JPEGE的通道数不随算力影响,但JPEGE+VENC的总通道数最大128。 :::
父主题: 媒体数据处理V1
基本概念
表1 关键概念列表
| 概念 | 描述 |
|---|---|
| 宽stride(widthStride) | 指一行图像跨距,表示输入/输出图片对齐后的宽,RGB格式和YUV格式的宽stride计算方式不一样。 各功能对宽stride的要求不同,请参见对应功能的约束说明: - VPC功能,请参见图片格式、宽高对齐、内存约束。 - JPEGD功能,请参见功能及约束说明。 - JPEGE功能,请参见功能及约束说明。 - PNGD功能,请参见功能及约束说明。 - VDEC功能,请参见功能及约束说明。 - VENC功能,请参见功能及约束说明。 |
| 高stride(heightStride) | 指图像在内存中的行数,表示输入/输出图片对齐后的高。 各功能对高stride的要求不同,请参见对应功能的约束说明: - VPC功能,请参见图片格式、宽高对齐、内存约束。 - JPEGD功能,请参见功能及约束说明。 - JPEGE功能,请参见功能及约束说明。 - PNGD功能,请参见功能及约束说明。 - VDEC功能,请参见功能及约束说明。 - VENC功能,请参见功能及约束说明。 |
| 上/下/左/右偏移 | 通过配置上偏移、下偏移、左偏移、右偏移可以实现两个功能:指定抠图区域或贴图区域的位置,控制抠图或贴图区域的宽、高,右偏移-左偏移+1=宽,下偏移-上偏移+1=高。参见图1。 |
| 抠图区域 | 指用户指定的需抠出的图片区域。 抠图区域最小分辨率为10*6,最大分辨率为4096*4096。 抠图区域的约束,请参见抠图、贴图约束。 |
| 贴图区域 | 指在输出图片中用户指定的区域,贴图区域最小分辨率为10*6,最大分辨率为4096*4096。 贴图区域的约束,请参见抠图、贴图约束。 |
| 非8K | 非8K表示10*6 - YUV400、YUV420SP、YUV422SP、YUV444SP:系数为1。 - YUV422packed:系数为2。 - YUV444packed、RGB888:系数为3。 - ARGB8888:系数为4。 |
| 8K | 8K表示宽或高在4096~8192(不包括4096)范围内的输入图片。 |
父主题: 媒体数据处理V1
acldvppMalloc
函数功能
该接口主要用于分配内存给Device侧媒体数据处理时使用,申请的大页内存满足数据处理的要求(例如,内存首地址128字节对齐),同步接口。
约束说明
-
调用该接口申请内存后,如果内存不使用,需及时调用acldvppFree接口释放内存。
-
频繁调用acldvppMalloc接口申请内存、调用acldvppFree接口释放内存,会损耗性能,建议用户提前做内存预先分配或二次管理,避免频繁申请/释放内存。
-
调用acldvppMalloc接口申请内存时,会对用户输入的size按向上对齐成32整数倍后,再多加32字节。
-
媒体数据处理的输出作为模型推理的输入时,若用户使用本接口申请大块内存并自行划分、管理内存时,每段内存需同时满足以下要求:
- 内存大小向上对齐成32整数倍+32字节(m=ALIGN_UP[len,32]+32字节);
- 内存起始地址需满足128字节对齐(ALIGN_UP[m,128])。
:::note 说明 len表示某段内存的大小,ALIGN_UP[len,k]表示向上按k字节对齐:((len-1)/k+1)*k。 :::
-
调用该接口申请大页内存失败,仅表示系统内的大页内存不够。
函数原型
aclError acldvppMalloc(void **devPtr, size_t size)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| devPtr | 输出 | “Device上已分配内存的指针”的指针。 |
| size | 输入 | 申请内存的大小,单位Byte。 |
返回值说明
返回0表示成功,返回其它值表示失败。
参考资源
接口调用流程及示例,参见媒体数据处理V1。
父主题: 内存申请与释放
在线提单