aclopSetKernelWorkspaceSizes
aclopSetKernelArgs
函数功能
动态Shape场景下,设置算子Tiling参数、执行并发数。
函数原型
aclError aclopSetKernelArgs(aclopKernelDesc *kernelDesc,
const char *kernelId,
uint32_t blockDim,
const void *args,
uint32_t argSize)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| kernelDesc | 输入 | Kernel描述缓存,aclopKernelDesc类型的指针。 text<br>typedef struct aclopKernelDesc aclopKernelDesc;<br> |
| kernelId | 输入 | 算子执行时要指定的Kernel ID的指针,与调用aclopCreateKernel时传递的kernelId一致。 |
| blockDim | 输入 | Kernel执行的并发AI Core核数。 建议此处设置的blockDim和TIK算子实现时的使用的AI Core核数保持一致。 |
| args | 输入 | Tiling参数的指针。 |
| argSize | 输入 | Tiling参数内存大小,单位为Byte。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: 算子编译
aclopSetKernelWorkspaceSizes
函数功能
动态Shape场景下,设置算子Workspace参数。为非必须接口,根据算子情况可选。
函数原型
aclError aclopSetKernelWorkspaceSizes(aclopKernelDesc *kernelDesc, int numWorkspaces, size_t *workspaceSizes)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| kernelDesc | 输入 | Kernel描述缓存,aclopKernelDesc类型的指针。 text<br>typedef struct aclopKernelDesc aclopKernelDesc<br> |
| numWorkspaces | 输入 | Workspaces个数。 |
| workspaceSizes | 输入 | Workspaces大小的数组地址指针。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: 算子编译
aclopUpdateParams
函数功能
在算子动态Shape场景下,根据指定算子,触发调用算子选择器。
函数原型
aclError aclopUpdateParams(const char *opType,
int numInputs,
const aclTensorDesc *const inputDesc[],
int numOutputs,
const aclTensorDesc *const outputDesc[],
const aclopAttr *attr**)**
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| opType | 输入 | 算子类型名称的指针。 |
| numInputs | 输入 | 算子输入tensor的数量。 |
| inputDesc | 输入 | 算子输入tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 inputDesc数组中的元素个数必须与numInputs参数值保持一致。 |
| numOutputs | 输入 | 算子输出tensor的数量。 |
| outputDesc | 输入 | 算子输出tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 outputDesc数组中的元素个数必须与numOutputs参数值保持一致。 |
| attr | 输入 | 算子属性的指针。 需提前调用aclopCreateAttr接口创建aclopAttr类型。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: 算子编译
aclopCompile
函数功能
编译指定算子。在编译算子前,可以调用aclSetCompileopt接口设置编译选项。
约束说明
- 每个算子的输入、输出组织不同,需要应用在调用时严格按照算子输入、输出参数来组织算子,用户在调用aclopCompile时,AscendCL根据optype、输入tensor的描述、输出tensor的描述、attr等信息查找对应的任务,再编译算子。
- 编译动态Shape的算子时,如果Shape具体值不明确,但Shape范围明确,则在调用aclCreateTensorDesc接口创建aclTensorDesc类型时,需要将dims数组的表示动态维度的元素值设置为-1,再调用aclSetTensorShapeRange接口设置tensor的各个维度的取值范围;如果Shape具体值以及Shape范围都不明确(该场景预留),则在调用aclCreateTensorDesc接口创建aclTensorDesc类型时,需要将dims数组的值设置为-2,例如:int64_t dims[] = {-2}。
- 编译有可选输入的算子时,如果可选输入不使用,则需按此种方式创建aclTensorDesc类型的数据:aclCreateTensorDesc(ACL_DT_UNDEFINED, 0, nullptr, ACL_FORMAT_UNDEFINED),表示数据类型设置为ACL_DT_UNDEFINED,Format设置为ACL_FORMAT_UNDEFINED,Shape信息为nullptr。
- 编译有constant输入的算子时,需要先调用aclSetTensorConst接口设置constant输入。调用aclopCompile接口、aclopExecuteV2接口前,设置的constant输入数据必须保持一致。
函数原型
aclError aclopCompile(const char *opType,
int numInputs,
const aclTensorDesc *const inputDesc[],
int numOutputs,
const aclTensorDesc *const outputDesc[],
const aclopAttr *attr,
aclopEngineType engineType,
aclopCompileType compileFlag,
const char* opPath**)**
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| opType | 输入 | 算子类型名称的指针。 |
| numInputs | 输入 | 算子输入tensor的数量。 |
| inputDesc | 输入 | 算子输入tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 inputDesc数组中的元素个数必须与numInputs参数值保持一致。 |
| numOutputs | 输入 | 算子输出tensor的数量。 |
| outputDesc | 输入 | 算子输出tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 outputDesc数组中的元素个数必须与numOutputs参数值保持一致。 |
| attr | 输入 | 算子属性的指针。 需提前调用aclopCreateAttr接口创建aclopAttr类型。 |
| engineType | 输入 | 算子执行引擎。 |
| compileFlag | 输入 | 算子编译标识。 |
| opPath | 输入 | 算子实现文件(*.py)的路径的指针,不包含文件名。 如果将compileFlag设置为ACL_COMPILE_UNREGISTERED时,需要设置opPath。 opPath只需要写到py文件所在的目录,不需要加上py文件名。可以写为绝对路径,也可以写为相对路径。当写为相对路径时,相对路径的父目录需配置到环境变量PYTHONPATH中。例如算子a.py放在绝对路径/A/B/C/下,opPath参数设置为相对路径./C时,则需要将/A/B加入到环境变量PYTHONPATH中。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: 算子编译
aclopSetCompileFlag
须知
此接口后续版本会废弃,请使用aclSetCompileopt接口设置编译选项。
函数功能
在编译算子前调用本接口设置算子编译标识,该设置进程级全局共享。
函数原型
aclError aclopSetCompileFlag(aclOpCompileFlag flag)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| flag | 输入 | 用于设置算子编译标识。 如果没有设置flag,则默认按照精确编译。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: 算子编译
aclGenGraphAndDumpForOp
函数功能
构建单个算子的图并Dump,生成.txt文件。此处的图是指表达算子IR(Intermediate Representation)的结构,图编译过程中由于融合、拆分等原因会导致图不断变换、进而生成新的图,这些变换的目的是为了将用户表达的图适配到昇腾AI处理器上,获得更高性能。
使用场景:算子调优场景下,调用本接口构建单个算子的图并Dump,生成.txt文件,作为算子调优的输入数据之一。
函数原型
aclError aclGenGraphAndDumpForOp(const char *opType,
int numInputs,
const aclTensorDesc *const inputDesc[],
const aclDataBuffer *const inputs[],
int numOutputs,
const aclTensorDesc *const outputDesc[],
aclDataBuffer *const outputs[],
const aclopAttr *attr,
aclopEngineType engineType,
const char *graphDumpPath,
const aclGraphDumpOption *graphDumpOpt)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| opType | 输入 | 指定算子类型名称的指针。 |
| numInputs | 输入 | 算子输入tensor的数量。 |
| inputDesc | 输入 | 算子输入tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 inputDesc数组中的元素个数必须与numInputs参数值保持一致,且inputs数组与inputDesc数组中的元素必须一一对应。 |
| inputs | 输入 | 算子输入tensor的指针数组。 需提前调用aclCreateDataBuffer接口创建aclDataBuffer类型的数据。 inputs数组中的元素个数必须与numInputs参数值保持一致,且inputs数组与inputDesc数组中的元素必须一一对应。 |
| numOutputs | 输入 | 算子输出tensor的数量。 |
| outputDesc | 输入 | 算子输出tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 outputDesc数组中的元素个数必须与numOutputs参数值保持一致,且outputs数组与outputDesc数组中的元素必须一一对应。 |
| outputs | 输入 | 算子输出tensor的指针数组。 需提前调用aclCreateDataBuffer接口创建aclDataBuffer类型的数据。 outputs数组中的元素个数必须与numOutputs参数值保持一致,且outputs数组与outputDesc数组中的元素必须一一对应。 |
| attr | 输入 | 算子属性的指针。 需提前调用aclopCreateAttr接口创建aclopAttr类型。 |
| engineType | 输入 | 算子执行引擎。 |
| graphDumpPath | 输入 | Dump单算子图所生成的文件(文件名后缀为.txt)的保存路径的指针。 路径需要由用户提前创建,路径中如果不指定文件名,则由AscendCL内部指定文件名。 如果多次Dump时,指定同一个路径,且文件名相同,则最新一次的文件会覆盖之前的文件。 |
| graphDumpOpt | 输入 | 单算子图的dump选项的指针。 当前该参数预留,仅支持传入nullptr。 |
返回值说明
返回0表示成功,返回其它值表示失败。
父主题: 算子编译
aclopSetModelDir
函数功能
设置加载模型文件的目录,该模型文件是由单算子编译成的*.om文件,同步接口。
约束说明
在加载前,请先根据单算子om文件的大小评估内存空间是否足够,内存空间不足,会导致应用程序异常。
Atlas 200/500 A2推理产品,在Host上运行应用时,一个进程内正在执行的算子的最大个数上限是40000000。
函数原型
aclError aclopSetModelDir(const char *modelDir)
参数说明
| 参数名 | 输入/输出 | 说明 |
|---|---|---|
| modelDir | 输入 | 模型文件路径的指针。 此处可设置多级目录,但系统最多从多级目录的最后一级开始,读取三级目录下的模型文件。 例如,将modelDir设置为"dir0/dir1",dir1下的目录层级为“dir2/dir3/dir4”,这时系统只支持读取“dir1”、“dir1/dir2”、“dir1/dir2/dir3”目录下的模型文件。 |
返回值说明
返回0表示成功,返回其它值表示失败。
参考资源
接口调用流程及示例,参见单算子调用。
父主题: 算子加载与执行
在线提单