跳到主要内容

aclopRegisterCompileFunc

aclnnMoeFFN

接口原型

每个算子有两段接口,必须先调用“aclnnMoeFFNGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小,再调用“aclnnMoeFFN”接口执行计算。两段式接口如下:

  • 第一段接口:aclnnStatus aclnnMoeFFNGetWorkspaceSize(const aclTensor *x, const aclIntArray *expertTokens, const aclTensor *weight1, const aclTensor *bias1, const aclTensor *weight2, const aclTensor *bias2, const aclTensor *scale, const aclTensor *offset, const aclTensor *deqScale1, const aclTensor *deqScale2, char *activation, const aclTensor *y, uint64_t *workspaceSize, aclOpExecutor **executor)
  • **第二段接口:****aclnnStatus aclnnMoeFFN(**void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)

功能描述

  • 算子功能:MoE(Mixture-of-Experts, 混合专家系统)是一种用于训练万亿参数量级模型的技术。MoE将预测建模任务分解为若干子任务,在每个子任务上训练一个专家模型(Expert Model),开发一个门控模型(Gating Model),该模型根据要预测的输入来学习信任哪个专家,最终综合多个专家计算结果作为预测结果。

  • 计算公式:

    假设输入样本为x,专家数为N,G(x)代表门控模型函数,FFEi(x)代表第i个专家的输出,所有专家的加权输出为

aclnnMoeFFNGetWorkspaceSize

  • 接口定义:

    aclnnStatus aclnnMoeFFNGetWorkspaceSize(const aclTensor *x, const aclIntArray *expertTokens, const aclTensor *weight1, const aclTensor *bias1, const aclTensor *weight2, const aclTensor *bias2, const aclTensor *scale, const aclTensor *offset, const aclTensor *deqScale1, const aclTensor *deqScale2, char *activation, const aclTensor *y, uint64_t *workspaceSize, aclOpExecutor **executor)

  • 参数说明:

    • x:Device侧的aclTensor,公式中的输入样本x,数据类型支持FLOAT16、INT8,数据格式支持ND,只支持输入为2维。
    • expertTokens:Host侧的aclIntArray类型,代表各专家的评估权重,数据类型支持INT64,数据格式支持ND,支持的最大长度为256个。
    • weight1:Device侧的aclTensor,专家的评估数据,数据类型支持FLOAT16、INT8,数据格式支持ND,输入为3维。
    • bias1:Device侧的aclTensor,专家的评估数据修正值,可选参数,数据类型支持FLOAT16、INT8,数据格式支持ND。
    • weight2:Device侧的aclTensor,专家的评估数据,数据类型支持FLOAT16、INT8,数据格式支持ND。
    • bias2:Device侧的aclTensor,专家的评估数据修正值,可选参数,数据类型支持FLOAT16、INT8,数据格式支持ND。
    • scale:Device侧的aclTensor,量化参数,可选,数据类型支持FLOAT,数据格式支持ND,一维向量,元素个数与expertTokens长度一致。
    • offset:Device侧的aclTensor,量化参数,可选,数据类型支持FLOAT,数据格式支持ND,一维向量,元素个数与expertTokens长度一致。
    • deqScale1:Device侧的aclTensor,第一个分组matmul的反量化参数,可选,数据类型支持UINT64,数据格式支持ND,输入2维,第一维等于expertTokens长度,第二维等于weight1第三维度。
    • deqScale2:Device侧的aclTensor,第二个分组matmul的反量化参数,可选,数据类型支持UINT64,数据格式支持ND,输入2维,第一维等于expertTokens长度,第二维等于weight2第三维度。
    • activation:Host侧的属性值,代表使用的激活函数,当前仅支持fastgelu。
    • y:Device侧的aclTensor,公式中的输出y,数据类型支持FLOAT、FLOAT16,数据格式支持ND。
    • workspaceSize:返回用户需要在Device侧申请的workspace大小。
    • executor:返回op执行器,包含了算子计算流程。
  • 返回值:

    返回aclnnStatus状态码,具体参见aclnn返回码

    :::note 说明 第一段接口完成入参校验,出现以下场景时报错:

    • 返回161001(ACLNN_ERR_PARAM_NULLPTR):传入的x、expertTokens、weight1、y或executor是空指针。
    • 返回161002(ACLNN_ERR_PARAM_INVALID):x、expertTokens、weight1、bias1、weight2、bias2、y的数据类型和数据格式不在支持的范围内。 :::

aclnnMoeFFN

  • 接口定义:

    aclnnStatus aclnnMoeFFN(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)

  • 参数说明:

    • workspace:在Device侧申请的workspace内存起址。
    • workspaceSize:在Device侧申请的workspace大小,由第一段接口aclnnMoeFFNGetWorkspaceSize获取。
    • executor:op执行器,包含了算子计算流程。
    • stream:指定执行任务的AscendCL stream流。
  • 返回值:

    返回aclnnStatus状态码,具体参见aclnn返回码

约束与限制

  • 专家数据的总数需要与BS(其中B表示输入样本批量大小、S表示输入样本序列长度)长度保持一致;
  • 专家个数不超过256个;
  • 当前MoeFFN实现过程中默认使用fastGelu激活函数,不支持gelu激活函数。

父主题: 融合类算子接口

aclnn返回码

调用算子接口时,常见的接口返回码如表1所示。

表1 返回状态码

状态码名称状态码值状态码说明
ACLNN_SUCCESS0成功。
ACLNN_ERR_PARAM_NULLPTR161001参数校验错误,参数中存在非法的nullptr。
ACLNN_ERR_PARAM_INVALID161002参数校验错误,如输入的两个数据类型不满足输入类型推导关系。 详细的错误消息,可以通过aclGetRecentErrMsg接口获取(该接口在acl.h中)。
ACLNN_ERR_RUNTIME_ERROR361001API内存调用npu runtime的接口异常。
ACLNN_ERR_INNER_XXX561xxxAPI发生内部异常,详细的错误消息,可以通过aclGetRecentErrMsg接口获取。请根据报错排查问题,或者联系技术支持。(您可以获取日志后单击Link联系技术支持。)

更多关于ACLNN_ERR_INNER_XXX类状态码的说明如表2所示。

表2 异常状态码

状态码名称状态码值状态码说明
ACLNN_ERR_INNER561000内部异常:API发生内部异常。
ACLNN_ERR_INNER_INFERSHAPE_ERROR561001内部异常:API内部进行输出shape推导发生错误。
ACLNN_ERR_INNER_TILING_ERROR561002内部异常:API内部做npu kernel的tiling时发生异常。
ACLNN_ERR_INNER_FIND_KERNEL_ERROR561003内部异常:API内部做查找npu kernel异常(可能因为opp kernel的包未安装)。
ACLNN_ERR_INNER_CREATE_EXECUTOR561101内部异常:API内部创建aclOpExecutor失败(可能因为操作系统异常)。
ACLNN_ERR_INNER_NOT_TRANS_EXECUTOR561102内部异常:API内部未调用uniqueExecutor ReleaseTo。
ACLNN_ERR_INNER_NULLPTR561103内部异常:aclnn API内部发生异常,出现了nullptr的异常。
ACLNN_ERR_INNER_WRONG_ATTR_INFO_SIZE561104内部异常:aclnn API内部发生异常,算子的属性个数异常。
ACLNN_ERR_INNER_KEY_CONFILICT561105内部异常:aclnn API内部发生异常,算子的kernel匹配的hash key发生冲突。
ACLNN_ERR_INNER_INVALID_IMPL_MODE561106内部异常:aclnn API内部发生异常,算子的实现模式参数错误。
ACLNN_ERR_INNER_OPP_PATH_NOT_FOUND561107内部异常:aclnn API内部发生异常,没有检测到需要配置的环境变量ASCEND_OPP_PATH。
ACLNN_ERR_INNER_LOAD_JSON_FAILED561108内部异常:aclnn API内部发生异常,加载算子kernel库中算子信息json文件失败。
ACLNN_ERR_INNER_JSON_VALUE_NOT_FOUND561109内部异常:aclnn API内部发生异常,加载算子kernel库中算子信息json文件的某个字段失败。
ACLNN_ERR_INNER_JSON_FORMAT_INVALID561110内部异常:aclnn API内部发生异常,算子kernel库中算子信息json文件的format填写为非法值。
ACLNN_ERR_INNER_JSON_DTYPE_INVALID561111内部异常:aclnn API内部发生异常,算子kernel库中算子信息json文件的dtype填写为非法值。
ACLNN_ERR_INNER_OPP_KERNEL_PKG_NOT_FOUND561112内部异常:aclnn API内部发生异常,没有加载到算子的二进制kernel库。
ACLNN_ERR_INNER_OP_FILE_INVALID561113内部异常:aclnn API内部发生异常,加载算子json文件字段时,发生异常。
ACLNN_ERR_INNER_ATTR_NUM_OUT_OF_BOUND561114内部异常:aclnn API内部发生异常,算子的属性个数与算子信息json中不一致,超过了json中指定的attr个数。
ACLNN_ERR_INNER_ATTR_LEN_NOT_ENOUGH561115内部异常:aclnn API内部发生异常,算子的属性个数与算子信息json中不一致,少于json中指定的attr个数。
ACLNN_ERR_INNER_INPUT_NUM_IN_JSON_TOO_LARGE561116内部异常:aclnn API内部发生异常,算子的输入个数超出32的限制。
ACLNN_ERR_INNER_INPUT_JSON_IS_NULL561117内部异常:aclnn API内部发生异常,算子信息json文件中,不存在对输出的信息描述。
ACLNN_ERR_INNER_STATIC_WORKSPACE_INVALID561118内部异常:aclnn API内部发生异常,解析静态二进制json文件中的workspace信息时,发生异常。
ACLNN_ERR_INNER_STATIC_BLOCK_DIM_INVALID561119内部异常:aclnn API内部发生异常,解析静态二进制json文件中的核数使用信息时,发生异常。

父主题: 融合类算子接口

aclopRegisterCompileFunc

函数功能

动态Shape场景下,注册算子选择器,用于在算子执行时,能针对不同shape,选择相应的Tiling策略。

约束说明

如果某算子已注册算子选择器,则不允许重新注册,如果需要变更算子选择器,必须先调用aclopUnregisterCompileFunc接口取消注册,然后再调用aclopRegisterCompileFunc接口重新注册。

函数原型

aclError aclopRegisterCompileFunc(const char *opType, aclopCompileFunc func)

参数说明

参数名输入/输出说明
opType输入算子类型的指针。
func输入算子选择器回调函数,函数定义: text<br>typedef aclError (*aclopCompileFunc)(int numInputs, const aclTensorDesc *const inputDesc[], int numOutputs, const aclTensorDesc *const outputDesc[], const aclopAttr *opAttr, aclopKernelDesc *aclopKernelDesc);<br>

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

aclopUnregisterCompileFunc

函数功能

动态Shape场景下,取消注册算子选择器。

函数原型

aclError aclopUnregisterCompileFunc(const char *opType)

参数说明

参数名输入/输出说明
opType输入算子类型的指针。

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

aclopCreateKernel

函数功能

动态Shape场景下,将算子注册到系统内部,运行算子时使用。

函数原型

aclError aclopCreateKernel(const char *opType,

const char *kernelId,

const char *kernelName,

void *binData,

int binSize,

aclopEngineType enginetype,

aclDataDeallocator deallocator)

参数说明

参数名输入/输出说明
opType输入算子类型的指针。
kernelId输入算子执行时要指定的Kernel ID的指针。
kernelName输入算子Kernel名称的指针,和算子二进制文件中的kernelName保持一致。
binData输入算子Kernel文件的内存地址指针。
binSize输入算子Kernel文件的内存大小,单位为Byte。
enginetype输入表示算子执行引擎。
text<br>typedef enum aclEngineType &#123;<br> ACL_ENGINE_SYS, //不关心具体执行引擎时填写<br> ACL_ENGINE_AICORE, //将算子编译成AI Core算子<br> ACL_ENGINE_VECTOR, //将算子编译成Vector Core算子<br>&#125; aclopEngineType;<br>
deallocator输入释放binData内存的回调函数,调用者根据binData的构造方法设置对应的释放函数。如果数据由调用者释放则设置为空。 函数签名为: typedef void (*aclDataDeallocator)(void *data, size_t length);

返回值说明

返回0表示成功,返回其它值表示失败。

父主题: 算子编译

在线提单