Skip to main content

aclopSetKernelWorkspaceSizes

aclopCreateKernel

函数功能

动态Shape场景下,将算子注册到系统内部,运行算子时使用。

函数原型

aclError aclopCreateKernel(const char *opType,

const char *kernelId,

const char *kernelName,

void *binData,

int binSize,

aclopEngineType enginetype,

aclDataDeallocator deallocator)

参数说明

参数名输入/输出说明
opType输入算子类型的指针。
kernelId输入算子执行时要指定的Kernel ID的指针。
kernelName输入算子Kernel名称的指针,和算子二进制文件中的kernelName保持一致。
binData输入算子Kernel文件的内存地址指针。
binSize输入算子Kernel文件的内存大小,单位为Byte。
enginetype输入表示算子执行引擎。
text<br>typedef enum aclEngineType &#123;<br> ACL_ENGINE_SYS, //不关心具体执行引擎时填写<br> ACL_ENGINE_AICORE, //将算子编译成AI Core算子<br> ACL_ENGINE_VECTOR, //将算子编译成Vector Core算子<br>&#125; aclopEngineType;<br>
deallocator输入释放binData内存的回调函数,调用者根据binData的构造方法设置对应的释放函数。如果数据由调用者释放则设置为空。 函数签名为: typedef void (*aclDataDeallocator)(void *data, size_t length);

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

aclopSetKernelArgs

函数功能

动态Shape场景下,设置算子Tiling参数、执行并发数。

函数原型

aclError aclopSetKernelArgs(aclopKernelDesc *kernelDesc,

const char *kernelId,

uint32_t blockDim,

const void *args,

uint32_t argSize)

参数说明

参数名输入/输出说明
kernelDesc输入Kernel描述缓存,aclopKernelDesc类型的指针。
text<br>typedef struct aclopKernelDesc aclopKernelDesc;<br>
kernelId输入算子执行时要指定的Kernel ID的指针,与调用aclopCreateKernel时传递的kernelId一致。
blockDim输入Kernel执行的并发AI Core核数。 建议此处设置的blockDim和TIK算子实现时的使用的AI Core核数保持一致。
args输入Tiling参数的指针。
argSize输入Tiling参数内存大小,单位为Byte。

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

aclopSetKernelWorkspaceSizes

函数功能

动态Shape场景下,设置算子Workspace参数。为非必须接口,根据算子情况可选。

函数原型

aclError aclopSetKernelWorkspaceSizes(aclopKernelDesc *kernelDesc, int numWorkspaces, size_t *workspaceSizes)

参数说明

参数名输入/输出说明
kernelDesc输入Kernel描述缓存,aclopKernelDesc类型的指针。 text<br>typedef struct aclopKernelDesc aclopKernelDesc<br>
numWorkspaces输入Workspaces个数。
workspaceSizes输入Workspaces大小的数组地址指针。

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

aclopUpdateParams

函数功能

在算子动态Shape场景下,根据指定算子,触发调用算子选择器。

函数原型

aclError aclopUpdateParams(const char *opType,

int numInputs,

const aclTensorDesc *const inputDesc[],

int numOutputs,

const aclTensorDesc *const outputDesc[],

const aclopAttr *attr**)**

参数说明

参数名输入/输出说明
opType输入算子类型名称的指针。
numInputs输入算子输入tensor的数量。
inputDesc输入算子输入tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 inputDesc数组中的元素个数必须与numInputs参数值保持一致。
numOutputs输入算子输出tensor的数量。
outputDesc输入算子输出tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 outputDesc数组中的元素个数必须与numOutputs参数值保持一致。
attr输入算子属性的指针。 需提前调用aclopCreateAttr接口创建aclopAttr类型。

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

aclopCompile

函数功能

编译指定算子。在编译算子前,可以调用aclSetCompileopt接口设置编译选项。

约束说明

  • 每个算子的输入、输出组织不同,需要应用在调用时严格按照算子输入、输出参数来组织算子,用户在调用aclopCompile时,AscendCL根据optype、输入tensor的描述、输出tensor的描述、attr等信息查找对应的任务,再编译算子。
  • 编译动态Shape的算子时,如果Shape具体值不明确,但Shape范围明确,则在调用aclCreateTensorDesc接口创建aclTensorDesc类型时,需要将dims数组的表示动态维度的元素值设置为-1,再调用aclSetTensorShapeRange接口设置tensor的各个维度的取值范围;如果Shape具体值以及Shape范围都不明确(该场景预留),则在调用aclCreateTensorDesc接口创建aclTensorDesc类型时,需要将dims数组的值设置为-2,例如:int64_t dims[] = {-2}。
  • 编译有可选输入的算子时,如果可选输入不使用,则需按此种方式创建aclTensorDesc类型的数据:aclCreateTensorDesc(ACL_DT_UNDEFINED, 0, nullptr, ACL_FORMAT_UNDEFINED),表示数据类型设置为ACL_DT_UNDEFINED,Format设置为ACL_FORMAT_UNDEFINED,Shape信息为nullptr。
  • 编译有constant输入的算子时,需要先调用aclSetTensorConst接口设置constant输入。调用aclopCompile接口、aclopExecuteV2接口前,设置的constant输入数据必须保持一致。

函数原型

aclError aclopCompile(const char *opType,

int numInputs,

const aclTensorDesc *const inputDesc[],

int numOutputs,

const aclTensorDesc *const outputDesc[],

const aclopAttr *attr,

aclopEngineType engineType,

aclopCompileType compileFlag,

const char* opPath**)**

参数说明

参数名输入/输出说明
opType输入算子类型名称的指针。
numInputs输入算子输入tensor的数量。
inputDesc输入算子输入tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 inputDesc数组中的元素个数必须与numInputs参数值保持一致。
numOutputs输入算子输出tensor的数量。
outputDesc输入算子输出tensor的描述的指针数组。 需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。 outputDesc数组中的元素个数必须与numOutputs参数值保持一致。
attr输入算子属性的指针。 需提前调用aclopCreateAttr接口创建aclopAttr类型。
engineType输入算子执行引擎。
compileFlag输入算子编译标识。
opPath输入算子实现文件(*.py)的路径的指针,不包含文件名。 如果将compileFlag设置为ACL_COMPILE_UNREGISTERED时,需要设置opPath。 opPath只需要写到py文件所在的目录,不需要加上py文件名。可以写为绝对路径,也可以写为相对路径。当写为相对路径时,相对路径的父目录需配置到环境变量PYTHONPATH中。例如算子a.py放在绝对路径/A/B/C/下,opPath参数设置为相对路径./C时,则需要将/A/B加入到环境变量PYTHONPATH中。

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

aclopSetCompileFlag

note

须知

此接口后续版本会废弃,请使用aclSetCompileopt接口设置编译选项。

函数功能

在编译算子前调用本接口设置算子编译标识,该设置进程级全局共享。

函数原型

aclError aclopSetCompileFlag(aclOpCompileFlag flag)

参数说明

参数名输入/输出说明
flag输入用于设置算子编译标识。 如果没有设置flag,则默认按照精确编译。

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

在线提单