참조#

이 장은 현재 qbcompiler의 명령줄, Python API, 설정 스키마, 지원 입력, 관련 용어에 대한 참조입니다. 기준은 현재 qbcompiler 구현입니다.

CLI 참조#

CLI는 다음 형식으로 실행합니다.

python -m qbcompiler <command> [options]

현재 명령은 compile, parse, quantize, dump-config, info, check, presets, validate, extract-body입니다. 아래 표는 이 매뉴얼이 예제로 다루는 다섯 가지를 정리합니다. presets는 컴파일 설정에서 다룹니다.

명령

목적

주요 옵션

compile

모델을 .mxq까지 한 번에 컴파일합니다. 내부적으로 임시 .mblt를 만든 뒤 quantize합니다.

--model, --output, --backend, --device, --target-device, --cpu-offload / --no-cpu-offload, --config-preset, --compile-config, --calib-data-path, --use-random-calib / --no-use-random-calib, --config-save-path

parse

입력 모델을 .mblt 중간 표현(IR)으로 변환합니다.

--model, --output, --backend, --device, --target-device, --cpu-offload / --no-cpu-offload, --config-preset, --compile-config

quantize

실행 가능한 .mblt 파일을 .mxq로 변환합니다.

--mblt, --output, --target-device, --calib-data-path, --use-random-calib / --no-use-random-calib, --config-preset, --compile-config, --device, --config-save-path

dump-config

기본값 또는 프리셋 기반 CompileConfig 템플릿을 작성합니다.

--output, --preset

info

.mblt에 기록된 provenance를 출력합니다.

--mblt

--backend 기본값은 onnx입니다. --calib-data-path는 여러 번 지정할 수 있습니다. --compile-config는 JSON, YAML, YML 파일을 받으며, 전용 CLI 플래그가 없는 고급 설정을 전달하는 확장 지점입니다. dump-config는 출력 파일 확장자에 따라 JSON 또는 YAML을 선택합니다.

하위 프로세스 연동에서는 JSONL 프로토콜을 명시적으로 활성화할 수 있습니다. QBCOMPILER_JSONL=1, true, yes, on 중 하나를 설정하면 stdout으로 구조화된 status, progress, result, log, error 메시지가 출력됩니다. 이 환경 변수가 없으면 일반 로그는 stderr로 출력됩니다.

Python API 참조#

공개 API는 qbcompiler 패키지에서 import합니다.

API

목적

mxq_compile(...)

주 Python 진입점입니다. 모델 또는 실행 가능한 .mblt를 .mxq로 컴파일합니다. 입력 종류를 보고 아래 두 함수로 위임합니다.

mxq_compile_from_source(...)

원본 모델(ONNX/PyTorch/TensorFlow/TF Lite/TorchScript)을 파싱한 뒤 .mxq로 컴파일합니다. 인자는 mxq_compile과 동일합니다.

mxq_compile_from_mblt(...)

이미 만들어진 .mblt, 또는 한 모델을 여러 크기로 만든 .mblt 파일 목록을 .mxq로 컴파일합니다. 첫 인자 이름은 model이 아니라 mblt입니다. 파싱이 끝난 그래프이므로 파서 전용 인자(save_subgraph_type, output_subgraph_path, feed_dict, dynamic_axes, multi_shape, yolo_decode_include, exclude_first_subgraph)는 없으며, 이런 인자를 넘기면 해당 인자 이름을 알리는 경고를 남기고 무시합니다. model_part와 model_part_options도 파싱에만 적용되므로 .mblt를 만들 때 mblt_compile()에 넘기세요. .mblt를 mxq_compile()에 넘기면서 둘 중 하나를 함께 주면 ValueError가 발생합니다.

mxq_compile_with_callback(...)

진행률 콜백을 받는 mxq_compile입니다.

mblt_compile_with_callback(...)

진행률 콜백을 받는 mblt_compile입니다. 출력 경로를 target device보다 먼저 받습니다.

read_provenance(mblt_path)

.mblt의 provenance 기록을 반환합니다. 기록이 없는 파일 — provenance 도입 이전이거나 기록을 끄고 만든 파일 — 은 None입니다. 그 외에는 두 컨테이너 형식 모두 기록을 담습니다.

mblt_compile(...)

.mxq를 만들지 않고 모델을 .mblt로 내보냅니다.

list_presets()

프리셋 메타데이터 사전 목록을 반환합니다.

dump_default_config(output_path, preset=None)

CompileConfig 템플릿을 JSON/YAML로 저장합니다.

get_body_subgraph(mblt_path, output_path)

NPU에서 실행 가능한 가장 큰 서브그래프와 그것이 호출하는 서브그래프들을 함께 담은 .mblt를 저장합니다. 호출만 되는 서브그래프는 본문으로 선택되지 않습니다.

set_log_level(level)

모든 qbcompiler 로거의 로그 레벨을 한 번에 설정합니다. logging 레벨 값이나 "debug", "warning" 같은 이름을 받습니다. qbcompiler 1.4에서 추가되었습니다.

기본 mxq_compile 사용 예:

from qbcompiler import mxq_compile

mxq_compile(
    model="model.onnx",
    target_device="aries-rb",
    calib_data_path="calib",
    save_path="model.mxq",
    backend="onnx",
    device="gpu",
    config_preset="classification",
    compile_config=None,
)

주요 인자는 model, target_device, calib_data_path, save_path, backend, feed_dict, dynamic_axes, multi_shape, yolo_decode_include, exclude_first_subgraph, device, inference_scheme, use_random_calib, cpu_offload, optimize_option, bias_correction, buffer_mode, force_npu_input_reposition, force_npu_output_reposition, image_channels, split_blocks, split_parts, config_preset, compile_config, config_save_path, model_part, model_part_options, 그리고 calibration_config, bit_config, llm_config, hessian_quant_config, bias_correction_config, mod_config, equivalent_transformation_config, search_weight_scale_config, uint8_input_config, preprocessing_config, save_sample_config, resource_management_config, 키워드 전용인 extra_output_config 같은 하위 설정 객체입니다.

multi_shape와 extra_output_config는 qbcompiler 1.4에서 추가되었습니다.

  • multi_shape는 한 모델을 입력 차원 하나의 여러 크기로 한 번에 컴파일합니다. feed_dict처럼 입력 이름을 키로 쓰고, 각 항목에 축과 그 축이 가질 크기를 지정합니다. 예: {"x": {"axis": 3, "values": [100, 200, 300]}}, 함께 움직이는 축은 {"x": {"axis": (2, 3), "values": [(224, 224), (448, 448)]}}. multi_shape.axis로 지정하는 입력 축은 ONNX로 export할 때 동적 축(dynamic axis)으로 지정되어 있어야 합니다.

    widths = (100, 200, 300)
    
    mxq_compile(
        model="model.onnx",
        backend="onnx",
        target_device="aries-rb",
        feed_dict={"x": example},
        multi_shape={"x": {"axis": 3, "values": widths}},
        calib_data_path=[f"calib/w{w}" for w in widths],
        save_path="model.mxq",
    )
    

    multi_shape를 사용하려면 feed_dict가 필요합니다. feed_dict의 텐서에서 지정한 축의 크기를 조정해 각 입력 크기에 맞는 예시 텐서를 생성하고, 모델을 크기마다 한 번씩 파싱합니다. 여러 입력을 지정하면 같은 인덱스끼리 묶어서 진행하므로 values 목록의 길이가 같아야 합니다. dynamic_axes 인자와 함께 사용할 수 없습니다. mblt_compile()은 크기마다 .mblt를 하나씩 씁니다. mblt_save_path에 크기별 경로 목록을 넘기거나, 경로 하나를 넘겨 <stem>_<i>.mblt로 받습니다. mxq_compile()은 원본 모델에 multi_shape를 지정하면 입력 크기별 .mblt 파일을 임시 디렉터리에 생성한 뒤 양자화를 한 번 실행하여 하나의 .mxq로 묶습니다. 또는 이미 생성한 .mblt 파일의 경로 목록을 model에 넘길 수도 있습니다. 이 경우 이미 파싱된 파일이므로 feed_dict, multi_shape 등의 파싱용 인자는 사용하지 않으며, 전달하면 경고를 남깁니다. 대신 양자화 전에 파일에 기록된 원본 모델 정보와 그래프 구조를 비교해 같은 모델인지 검사하고, 다르면 차이를 알려주며 거부합니다. 두 경우 모두 calib_data_path에는 크기마다 캘리브레이션 디렉터리를 하나씩 values와 같은 순서로 넘깁니다.

  • extra_output_config는 이름을 지정한 중간 레이어를 MXQ 출력에 추가합니다. 컴파일 설정 — 중간 활성값 내보내기를 참고합니다.

qbcompiler 1.4에서는 레거시 Model_Dict 파서와 그 파서만 읽던 인자도 제거되었습니다. qbcompiler.Model_Dict, qbcompiler.compiler.LegacyCompiler, qbcompiler.compiler.compiler_legacy는 더 이상 없으므로 mxq_compile() 또는 mblt_compile()을 사용합니다. in_dformats나 input_shape_dict를 넘기면 ValueError가 발생합니다. 입력 레이아웃은 모델에서 추론하고, input_shape_dict는 multi_shape로 대체되었습니다. layer_bias_correction과 layer_bias_correction_config의 이름은 bias_correction과 bias_correction_config로 바뀌었습니다.

config_save_path, model_part, model_part_options는 qbcompiler 1.3에서 추가되었습니다.

  • config_save_path는 컴파일이 시작되기 전에 완전히 해석된 CompileConfig를 기록합니다. 아래 우선순위의 모든 단계가 적용된 정규화 결과입니다. 확장자가 .yaml 또는 .yml이면 YAML로, 그 외에는 JSON으로 기록하며 상위 디렉터리는 자동으로 생성됩니다. 컴파일보다 먼저 기록되므로 시작된 뒤 실패한 컴파일에서도 기록이 남고, 이 파일을 그대로 compile_config=로 넘기면 동일한 컴파일을 재현할 수 있습니다. 다만 quantize 단계가 기록하므로, compile이 파싱 도중 실패하면 아무것도 남지 않습니다. CLI에서는 quantize와 compile의 --config-save-path 옵션으로 제공됩니다.

  • model_part는 여러 부분으로 구성된 torch 모델에서 파싱할 부분("vision", "language", "encoder" 등)을 지정하고, model_part_options는 그 부분에 필요한 추가 인자(예: {"mel_frames": 100})를 전달합니다. 부분을 하나만 선언한 모델은 None에서 자동으로 결정되고, 여러 개를 선언한 모델은 이름을 지정해야 합니다. 목록은 qbcompiler.model_dict.parser.patcher.parts의 available_parts(model)로 확인합니다. 이제 ValueError를 발생시키는 hf_config 인자를 대체합니다.

설정 해석 우선순위 (높은 쪽이 우선): 명시적 인자 → 하위 설정 객체 → compile_config 파일 또는 config_preset 중 주어진 쪽 → 기본값. 둘 다 주면 프리셋이 쓰이고 파일은 무시됩니다. 자세한 내용과 사용 예시는 컴파일 설정 — 설정 해석 우선순위를 참고합니다.

CompileConfig 스키마#

CompileConfig는 별칭을 지원하는 Pydantic model이며 extra="forbid"입니다. JSON/YAML 파일에서는 별칭 이름을 사용합니다. 전체 템플릿은 다음 명령으로 생성할 수 있습니다.

python -m qbcompiler dump-config --output compile_config.yaml
python -m qbcompiler dump-config --preset yolo_640 --output yolo_640.yaml

최상위 필드:

Alias

Python field

기본값

의미

modelPaths

model_paths

[]

모델 경로 목록입니다. 보통 API/CLI 인자로 전달합니다.

calibDataPaths

calib_data_path

[]

캘리브레이션 데이터셋 경로 목록입니다.

savePaths

save_paths

["./tmp.mxq"]

MXQ 출력 경로 목록입니다.

useRandomCalib

use_random_calib

false

무작위 캘리브레이션 데이터를 생성합니다.

inferenceScheme

inference_scheme

single

생성되는 MXQ에 컴파일 시점에 적용할 NPU 코어 할당 방식입니다. inferenceScheme을 참고합니다.

cpuOffload

cpu_offload

false

지원되지 않는 연산 범위의 CPU 오프로딩을 활성화합니다.

forceNpuInputReposition

force_npu_input_reposition

false

입력 reposition op를 NPU에서 실행하도록 강제합니다.

forceNpuOutputReposition

force_npu_output_reposition

false

출력 reposition op를 NPU에서 실행하도록 강제합니다.

optimizeOption

optimize_option

1

백엔드 최적화 선택값입니다. 0, 1, 2, 3, 4, 99를 받습니다. qbcompiler 1.4부터는 그 밖의 값을 무시하지 않고 백엔드 컴파일 단계에서 거부합니다.

bufferMode

buffer_mode

1

버퍼 직렬화 모드입니다.

device

device

gpu

컴파일 계산 장치입니다. gpu 또는 cpu입니다.

dtype

dtype

float

계산 데이터 타입 메타데이터입니다.

debug

debug

false

디버그 모드를 활성화합니다.

trace

trace

false

추적 모드를 활성화합니다.

imageChannels

image_channels

0

이미지 채널 수입니다. 0은 자동 감지입니다.

configVersion

config_version

1.0.0

설정 스키마 버전입니다.

splitBlocks

split_blocks

[]

LLM 다중 MXQ 분할 지점의 block index 목록입니다.

splitParts

split_parts

0

LLM transformer block을 N개 부분으로 나눕니다.

중첩 섹션:

Alias

Type

목적

uint8Input

Uint8InputConfig

모델 입력을 uint8로 취급합니다. 입력 이름별 지정도 가능합니다.

preprocessing

PreprocessingConfig

크기 변경, letterbox, 자르기, 정규화, 형식 변환 같은 입력 전처리 파이프라인입니다.

resourceManagement

ResourceManagementConfig

가중치 데이터 타입, 가중치 양자화의 GPU 메모리 예산(gpuMemoryBudgetMB, MiB 단위, 기본값 -1은 자동, 0은 무제한), 가중치 메모리 방식입니다. useGPUOnlyForCalibration은 1.4에서 제거되었습니다.

calibration

CalibrationConfig

양자화 방식, 출력 양자화, 캘리브레이션 모드, clipping/statistics, 레이어별 재정의입니다.

bit

BitConfig

양자화 정밀도 설정입니다.

hessianQuant

HessianQuantConfig

hessianDtype, solver, rescomp, attributes.alpha를 포함한 HessianQuant 최적화 설정입니다. accumulationDevice는 1.4에서 제거되었습니다. 모델 양자화를 참고합니다.

biasCorrection

BiasCorrectionConfig

양자화로 생기는 채널별 편향을 보정하는 설정입니다. 기본으로 켜져 있습니다. 1.4부터 layerBiasCorrection을 대체합니다.

mod

ModConfig

MOD 학습/최적화 설정입니다.

llm

LlmConfig

LLM 시퀀스/캐시/런타임/디버그 설정입니다. runtime.batchSize가 1보다 크면 inferenceScheme은 single, global4, global8 중 하나여야 하며 multi와 all은 거부됩니다. Batch LLM 런타임 API는 BatchParam 메타데이터를 사용합니다. qb Runtime 릴리즈 노트를 참고합니다.

moe

MoeConfig

Sparse MoE 캘리브레이션 전문가 선택 설정입니다.

equivalentTransformation

EquivalentTransformationConfig

SmoothQuant 계열, rotation, FFN 동등 변환 설정입니다.

searchWeightScale

SearchWeightScaleConfig

가중치 스케일 탐색 설정입니다.

loadScale

LoadScaleConfig

외부 스케일 항목 로드 설정입니다.

runtimeOptions

RuntimeOptions

내부 런타임 메타데이터입니다.

saveSample

SaveSampleConfig

검사/디버깅용 샘플 데이터 저장 설정입니다.

extraOutput

ExtraOutputConfig

이름을 지정한 중간 레이어를 MXQ 출력에 추가합니다(apply, layers). 1.4에서 추가되었습니다.

CompileConfig.from_file()은 .json, .yaml, .yml을 받습니다. 호환성을 위해 quantization.calibration, quantization.bit, advancedQuantization.hessianQuant, advancedQuantization.mod, advancedQuantization.EquivalentTransformation, advancedQuantization.searchWeightScale, advancedQuantization.loadScale, 그리고 1.4부터 1.3의 advancedQuantization.layerBiasCorrection을 대체하는 advancedQuantization.biasCorrection 같은 그룹화된 키도 평탄화합니다. 그룹화된 표기는 도구가 내보내는 형태이기도 합니다. dump-config와 --config-save-path가 모두 이 형태로 씁니다. 평탄화는 병합이 아니라 덮어쓰기이므로, quantization.calibration이 있는 파일에 최상위 calibration 블록을 나란히 두면 아무 메시지 없이 버려집니다. 한 파일에서 두 표기를 섞지 마세요.

inferenceScheme#

inferenceScheme은 qb Runtime이 MXQ를 추론에 사용할 때 NPU core 연산을 어떤 방식으로 할당할지 선택합니다. 컴파일된 MXQ는 선택한 core 할당 방식에 맞게 준비되므로, 특정 모드만으로 만든 MXQ를 런타임에서 임의의 다른 모드로 바꿔 실행할 수는 없습니다. all로 빌드한 MXQ는 모델과 target device가 지원하는 모든 모드를 담지만, 호출하는 쪽이 하나를 지정해야 합니다. qb Runtime의 기본값인 CoreMode::Auto는 코어 모드가 정확히 하나인 MXQ만 받으므로, all 빌드에는 setSingleCoreMode()나 setGlobal4CoreMode() 같은 명시적 지정이 필요합니다. ARIES ModelConfig 구성을 참고하세요.

사용 가능한 값은 single, multi, global4, global8, all입니다. single은 독립적인 Local Core 실행, multi는 cluster 단위 4-batch 모드, global4/global8은 4개 또는 8개 Local Core가 한 입력을 함께 처리하는 모드입니다. all은 선택한 모델과 target device가 지원하는 모든 코어 모드에서 사용할 수 있도록 MXQ를 준비합니다. 지원 여부는 모델, target device, 컴파일러 버전에 따라 달라질 수 있습니다. REGULUS는 NPU 코어가 1개이므로 REGULUS용으로 컴파일한 MXQ에서는 single 모드만 사용할 수 있습니다. qbcompiler 1.3부터는 나중에 실패하도록 두지 않고 이를 강제합니다. 단일 코어 target device에서 multi, global4, global8은 즉시 거부되고 all은 single로 좁혀집니다. 스킴과 target device 중 무엇을 먼저 설정했는지와 무관하게 양자화 이전에 검사합니다. global은 레거시/호환성 값이므로 새 설정에서는 global4 또는 global8을 사용합니다.

llm.attributes.runtime.batchSize가 1보다 크면 LLM/KV 캐시 transformer 컴파일은 single, global4, global8을 받고 multi와 all은 좁히지 않고 거부합니다. 세그먼트 하나가 시나리오 하나로 컴파일되는데, 어느 쪽을 의도했는지 추측하면 요청하지 않은 코어 구성으로 빌드하게 되기 때문입니다. 비전 배치 추론과 LLM 배치 추론은 같은 코어 모드 규칙을 사용하지 않습니다.

각 모드의 의미는 ARIES Core 모드를, 런타임에서 core/cluster를 선택하는 방법은 ARIES ModelConfig 구성을 참고합니다.

RuntimeOptions#

RuntimeOptions의 현재 필드는 하나입니다.

Field

기본값

의미

version

0.0.0

컴파일러/런타임 버전 메타데이터입니다.

이 섹션은 일반 사용자 튜닝 인터페이스라기보다 런타임 메타데이터입니다. 사용자가 동작을 조정할 때는 컴파일, 캘리브레이션, 전처리, LLM, 최적화 관련 섹션을 우선 사용합니다.

프리셋 목록#

프리셋

기반 프리셋

동작

classification

없음

이미지 분류 기본값입니다. calibration.mode=1, calibration.output=0.

detection

없음

객체 탐지 기본값입니다. calibration.mode=1, calibration.output=1.

classification_torchvision

classification

uint8 입력과 Torchvision 표준 전처리를 활성화합니다. Pillow 백엔드(backend: "pil")로 짧은 변을 256으로 크기 변경, 224x224 가운데 자르기, ImageNet 평균/표준편차 정규화, imageChannels=3.

yolo_640

detection

uint8 입력과 640x640 letterbox 전처리를 활성화합니다. pad value는 114이고 OpenCV 백엔드(backend: "opencv")를 쓰며 imageChannels=3입니다.

yolo_1280

detection

uint8 입력과 1280x1280 letterbox 전처리를 활성화합니다. pad value는 114이고 OpenCV 백엔드(backend: "opencv")를 쓰며 imageChannels=3입니다.

llm

없음

LLM 설정을 활성화합니다. maxSequenceLength=4096, maxCacheLength=4096, calibration.mode=0, calibration.output=0, LLM 캘리브레이션의 전체 시퀀스 길이 사용, 그리고 QK, UD, VO, SpinR1, SpinR2, OptimizeFFN 동등 변환을 활성화합니다.

llm_fast

llm

위 여섯 가지 동등 변환과 전체 시퀀스 길이 캘리브레이션을 비활성화하여, 정확도를 내주고 컴파일 시간을 줄입니다.

vision_transformer

없음

transformer 지향 캘리브레이션/bit 설정입니다.

multimodal

없음

LLM 처리를 활성화하고 calibration.method=3을 사용합니다.

qbcompiler 1.4부터 세 이미지 프리셋은 기준 평가 코드와 맞추기 위해 Pillow와 OpenCV 백엔드를 사용합니다. 따라서 캘리브레이션 텐서와 양자화 결과가 1.3과 다를 수 있습니다.

지원 프레임워크#

컴파일 지원 프레임워크는 다음과 같습니다. 백엔드 이름은 대소문자를 구분하지 않습니다. qbcompiler 1.4부터는 모든 백엔드가 현재 파서를 사용하며, tf, tflite, torchscript도 더 이상 레거시 파서를 거치지 않습니다.

백엔드

입력

onnx

ONNX model path입니다. 기본 경로이며 validate_model이 지원하는 backend입니다.

tf

TensorFlow SavedModel 디렉터리, Keras .keras / .h5 파일, frozen GraphDef .pb입니다. tensorflow와 keras도 이 백엔드의 다른 이름으로 받습니다.

tflite

TensorFlow Lite .tflite model path입니다.

torchscript

torch.jit.save로 저장한 아카이브 경로입니다. 먼저 ONNX로 내보내므로 feed_dict가 필요합니다.

torch

PyTorch model 또는 HuggingFace/transformers model path/object 흐름입니다. HuggingFace LLM은 별도 hf backend가 아니라 이 backend path를 사용합니다.

지원 target device#

CLI와 Python API에는 다음 target device 문자열을 사용합니다.

target device

설명

regulus-ra

REGULUS RA target입니다.

aries-rb

ARIES RB target입니다.

regulus-rb

REGULUS RB target입니다.

regulus-rb-usb

USB로 연결된 REGULUS RB target입니다. qbcompiler 1.3부터 지원합니다.

Validator는 위 공개 문자열을 받습니다. 내부 enum 이름은 underscore를 쓰지만, 사용자가 입력하는 값은 hyphen을 사용합니다.

지원 연산자#

Mobilint IR 연산 목록에 Mobilint 하드웨어가 네이티브로 실행하는 연산 목록이 있습니다. 다만 그것만으로 결정되지는 않습니다. 목록에 없는 연산도 그래프 수준 변환을 거쳐 컴파일될 수 있고, 특정 연산이 네이티브로 실행되는지는 모델, backend, 형상, target device에 따라 파서와 target-device 할당 로직이 컴파일마다 판단합니다.

사용 가능한 확인 경로:

  • ONNX가 아닌 backend는 모델을 parse/compile한 뒤 .mblt와 CPU 오프로딩 작업 흐름으로 지원되지 않는 연산 범위를 확인합니다.

  • 모델에 지원되지 않는 연산 범위가 있으면 런타임 흐름이 지원하는 범위에서 cpuOffload / cpu_offload로 CPU 실행 분할을 사용할 수 있습니다.

용어집#

용어

의미

MXQ

양자화/컴파일 결과로 생성되는 Mobilint 실행 패키지이며 Mobilint NPU에서 실행됩니다.

MBLT

파싱과 MXQ 생성 사이에 사용하는 Mobilint 중간 모델 형식입니다.

parse

원본 모델을 .mblt로 변환하는 단계입니다.

quantize

실행 가능한 .mblt를 캘리브레이션/설정 값에 따라 .mxq로 변환하는 단계입니다.

compile

parse와 quantize를 포함하는 전체 컴파일 흐름입니다.

backend

onnx, torch, tflite 같은 원본 모델 프레임워크 식별자입니다.

target_device

aries-rb 같은 Mobilint NPU target device 문자열입니다.

NPU 칩

ARIES, REGULUS 같은 Mobilint NPU 제품 이름입니다.

target device

aries-rb, regulus-ra, regulus-rb, regulus-rb-usb 같은 컴파일 대상이며 target device 문자열로 사용합니다.

calibration data

양자화 스케일/통계를 계산하는 대표 입력 텐서입니다.

CPU 오프로딩

지원되지 않는 그래프 그룹은 CPU에서 실행하고 지원되는 본문 서브그래프는 NPU에서 실행하도록 분할하는 방식입니다.

본문 서브그래프(body subgraph)

분할된 .mblt에서 추출한, NPU에서 실행 가능한 가장 큰 지원 서브그래프입니다.

preset

주요 모델 계열을 위한 내장 부분 CompileConfig입니다.

라이선스#

이 매뉴얼에 포함된 오픈소스 라이선스 공지는 라이선스를 참고합니다.