Inference
De definitie
Inference (of inferentie) is de fase waarin een getraind AI-model daadwerkelijk wordt gebruikt om voorspellingen te doen of output te genereren op basis van nieuwe, ongeziene input. Dit staat in contrast met training, waarbij de gewichten van een model worden geoptimaliseerd op een dataset. Tijdens inference blijven de modelgewichten vastliggen; het model voert alleen een forward pass uit om een antwoord, classificatie of gegenereerde tekst te produceren. Bij grote taalmodellen is inference een aanzienlijke technische uitdaging op zichzelf, met vraagstukken rond latency, doorvoersnelheid (throughput), geheugengebruik en kosten per token. Technieken zoals batching, quantization, key-value caching en speculative decoding worden ingezet om inference sneller en goedkoper te maken, vooral bij grootschalige productie-inzet.
Inference Op de arbeidsmarkt
Inference-optimalisatie is een snelgroeiend specialisme binnen de AI-arbeidsmarkt, gedreven door de hoge operationele kosten van het draaien van grote modellen op schaal. Bedrijven die AI-producten in productie brengen, zoeken engineers die inferencekosten kunnen verlagen zonder in te leveren op kwaliteit of latency. In Nederland is deze expertise sterk gevraagd bij scale-ups die generatieve AI-features aanbieden, cloudproviders en bedrijven met on-premise of edge AI-toepassingen waar rekenkracht en privacy belangrijke overwegingen zijn, zoals in de gezondheidszorg en industrie.
Kernvaardigheden & tools
-
Technieken: Quantization (INT8/INT4), Batching, KV-caching, Speculative decoding, Model distillation
-
Serving frameworks: vLLM, TensorRT-LLM, Triton Inference Server, TGI (Text Generation Inference), Ollama
-
Infrastructuur: GPU-clusters, Kubernetes, Autoscaling, Load balancing
-
Concepten: Latency vs. throughput, Cost per token, Model compression, Edge deployment
-
Talen: Python, C++, CUDA
Veelvoorkomende functietitels
-
Inference Engineer
-
ML Infrastructure Engineer
-
Performance Engineer (AI)
-
MLOps Engineer
-
AI Platform Engineer



