This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Wednesday, 12 November 2025
WAARSCHUWING: Deze zijn ontwerp-Posts die 'onthuld'.
Het is waarschijnlijk veel van wat hieronder zal niet werken; IK genereren deze als how-to voor MIJ en dan doen alle stappen en krijg de sample app werken...Je bent stiekem en ze gezien! ze zullen waarschijnlijk klaar zijn medio december.
## Inleiding
Welkom in deel 2Deel 1
, legden we de visie voor het bouwen van een schrijfassistent die uw blog gebruikt als een kennisbasis - zoals hoe advocaten LLM's gebruiken opgeleid op het gebied van jurisprudentie om documenten te ontwerpen.
**Nu is het tijd om onze handen vuil te maken met de fundering: ervoor zorgen dat je GPU klaar is voor AI workloads.**OPMERKING: Dit maakt deel uit van mijn experimenten met AI (ondersteund opstellen) + mijn eigen bewerking.
Dezelfde stem, hetzelfde pragmatisme, gewoon snellere vingers.Over mijn hardware: Ik gebruik een NVIDIA RTX A4000 (16GB VRAM), AMD Ryzen 9 9950X en 96GB DDR5 RAM.Maar je hebt dit niet nodig!Zoals beschreven in deel 1, kunt u elke NVIDIA GPU met 8GB+ VRAM gebruiken, of zelfs CPU-alleen uitvoeren (langzamer maar functioneel).
Dit deel lijkt misschien basic als je al bekend bent met
graph LR
A[AI Workload] --> B{Type?}
B -->|Matrix Operations| C[GPU: 100x+ faster]
B -->|Sequential Logic| D[CPU: Better]
C --> E[Embedding Generation]
C --> F[LLM Inference]
C --> G[Vector Search]
D --> H[Application Logic]
D --> I[File I/O]
class C gpu
class E,F,G aiTasks
classDef gpu stroke:#333,stroke-width:4px
classDef aiTasks stroke:#333
, maar geloof me - ik heb ontelbare uren verspild met het debuggen van mysterieuze fouten die terug te voeren naar versie mismatches, ontbrekende omgevingsvariabelen, of onjuist:
- GPU's hebben duizenden kernen vs. CPU's' tientallenMatrixbewerkingen
- AI is meestal matrix wiskunde, die GPU's blinken uit opGeheugenbandbreedte
- GPU's verplaatsen data veel snellerGespecialiseerde hardware
Tensor kernen versnellen AI-specifieke bewerkingen
Voorbeeld in de echte wereld(op mijn hardware): Het genereren van inbeddingen voor een blog post:
(24GB): Snelste, ~0.2s per post
(12GB): ~0,5s per post
6144 CUDA-kernen
RTX 4090 24GB 13B-30B Overkill voor dit projectRTX 4070 Ti, 12GB, 7B-13B, Uitstekende keuze.
RTX 3060 12GB 7B Budgetvriendelijk* RTX 4060 Ti * 16GB * 7B-13B * Great value *
A4000 (mijn) 16GB 7B-13B Werkstation GPU:
: NPU's ondersteunen CUDA niet, die deze tutorial gebruikt:
: Nog steeds rijpen voor LLM'sAls u een met NPU uitgeruste CPU heeftGebruik CPU-alleen-modus voor nu (alles werkt, gewoon langzamer)
ONNX Runtime DirectML
# PowerShell
wmic path win32_VideoController get name
updates
Name
NVIDIA RTX A4000
Toekomstige onderdelen zullen merken wanneer NPU-ondersteuning verbetert
NVIDIA CUDA
graph TB
A[Your C# Application] --> B[ONNX Runtime / LLamaSharp]
B --> C[CUDA Toolkit]
C --> D[cuDNN Libraries]
D --> E[NVIDIA Driver]
E --> F[GPU Hardware]
G[TensorRT] -.Optional.-> D
class A,F endpoints
class C,D,E install
classDef endpoints stroke:#333,stroke-width:4px
classDef install stroke:#333,stroke-width:2px
subgraph "What We'll Install"
C
D
E
end
want het is volwassen en goed ondersteund in .NET, maar de concepten zullen vertalen naar NPU's zodra het ecosysteem inhaalt!:
cuDNN
graph LR
A[1. NVIDIA Driver] --> B[2. CUDA Toolkit]
B --> C[3. cuDNN]
C --> D[4. Verify Install]
D --> E[5. Test from C#]
class A,B,C,D,E steps
classDef steps stroke:#333,stroke-width:2px
nvidia-smi
Uw aanvraag
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 546.33 Driver Version: 546.33 CUDA Version: 12.3 |
|-------------------------------+----------------------+----------------------+
| GPU Name TCC/WDDM | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. |
|===============================+======================+======================|
| 0 NVIDIA RTX A4000 WDDM | 00000000:01:00.0 Off | Off |
| 41% 32C P8 10W / 140W | 345MiB / 16376MiB | 0% Default |
+-------------------------------+----------------------+----------------------+
- Onze C# code.:
Driver VersionRoutekaart installerenCUDA VersionHier is de bestelling die we zullen installeren dingen (order matches!):Memory-UsageStap 1: NVIDIA DriverOpen PowerShell:nvidia-smiU zou de uitvoer moeten zien als:
Belangrijkste informatie: Moet 545.xx of nieuwer zijn
: Dit is de MAX CUDA versie ondersteund, niet wat geïnstalleerd is
RTX A4000
Besturingssysteem:nvidia-smi
(of uw versie)
Studio-driver(meer stabiel dan Game Ready)Installeren en opnieuw opstartenWeer controleren met
CUDA Toolkit Archief
Installation Type: Custom (Advanced)
Select Components:
✅ CUDA Toolkit
✅ CUDA Documentation
✅ CUDA Samples
✅ CUDA Visual Studio Integration
❌ GeForce Experience (not needed)
❌ NVIDIA Driver (already installed)
SelecterenCUDA Toolkit 12.1
Kies:
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1
Windows → x86_64 → 11 → exe (lokaal)
Installatieopties
Controleer de installateur.:
$env:CUDA_PATH
# Should show: C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1
$env:PATH -split ';' | Select-String CUDA
# Should show CUDA bin and libnvvp paths
Wanneer gevraagd::
Waarom op maat?: We willen onze driver niet downgraden of gaming software installeren.:
This PCStandaard pad is prima:Maar let op: we hebben het nodig voor omgevingsvariabelen!Omgevingsvariabelen instellenDe installateur stelt deze meestal in, maar verifieer:
CUDA_PATH = C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1CUDA_PATH_V12_1 = C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1Check in PowerShellPathIndien ontbreken, handmatig toevoegen
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\bin
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\libnvvp
OpenenOmgevingsvariabelen
# Check CUDA compiler
nvcc --version
# Should output:
# nvcc: NVIDIA (R) Cuda compiler driver
# Copyright (c) 2005-2023 NVIDIA Corporation
# Built on Tue_Feb__7_19:32:13_Pacific_Standard_Time_2023
# Cuda compilation tools, release 12.1, V12.1.66
# Check path resolves
where.exe nvcc
# Should show: C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\bin\nvcc.exe
Onder
, verifiëren/toevoegen:: Invariabele, zorg ervoor dat deze bestaan:
Uw terminal opnieuw opstartenvoor wijzigingen die van kracht wordenCUDA-installatie verifiëren**Stap 3: cuDNN (CUDA Deep Neural Network library)**cuDNN biedt geoptimaliseerde implementaties van deep learning operaties.
Ga naar
cuDNN-archiefJe hebt een NVIDIA Ontwikkelaar account nodig (gratis)
cudnn-windows-x86_64-8.9.7.29_cuda12-archive\
bin\
cudnn64_8.dll
cudnn_adv_infer64_8.dll
cudnn_adv_train64_8.dll
... (more DLLs)
include\
cudnn.h
... (header files)
lib\
x64\
cudnn.lib
... (lib files)
Zoeken::
# Assuming you extracted to Downloads and CUDA is in default location
# Run PowerShell as Administrator
$cudnnPath = "$env:USERPROFILE\Downloads\cudnn-windows-x86_64-8.9.7.29_cuda12-archive"
$cudaPath = "C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1"
# Copy DLLs
Copy-Item "$cudnnPath\bin\*.dll" -Destination "$cudaPath\bin\"
# Copy headers
Copy-Item "$cudnnPath\include\*.h" -Destination "$cudaPath\include\"
# Copy libs
Copy-Item "$cudnnPath\lib\x64\*.lib" -Destination "$cudaPath\lib\x64\"
Download cuDNN v8.9,7 (5 december 2023), voor CUDA 12.x:
bin\Lokale installatie voor Windows (Zip)C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\bin\include\Uitpakken en installeren van cuDNNC:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\include\lib\x64\De ZIP uitpakkenC:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\lib\x64\# Check DLLs exist
Test-Path "C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\bin\cudnn64_8.dll"
# Should return: True
# List all cuDNN DLLs
Get-ChildItem "C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\bin\cudnn*.dll"
Of doe het handmatig
nvidia-smi
tot
nvcc --version
tot
# All these should return paths
$env:CUDA_PATH
$env:CUDA_PATH_V12_1
# Check PATH includes CUDA bin
$env:PATH -split ';' | Select-String CUDA
CuDNN installatie verifiëren
Stap 4: Volledige verificatie:
cd "C:\ProgramData\NVIDIA Corporation\CUDA Samples\v12.1"
Laten we ervoor zorgen dat alles samen werkt.:
cd "1_Utilities\deviceQuery"
HardwarecontroleMoet uw GPU tonen zonder fouten.
# If you have VS 2022
"C:\Program Files\Microsoft Visual Studio\2022\Community\MSBuild\Current\Bin\MSBuild.exe" deviceQuery_vs2022.vcxproj /p:Configuration=Release /p:Platform=x64
CUDA-controle:
.\x64\Release\deviceQuery.exe
Moet CUDA 12.1 (of welke versie je ook hebt geïnstalleerd) tonen.
CUDA Device Query (Runtime API) version (CUDART static linking)
Detected 1 CUDA Capable device(s)
Device 0: "NVIDIA RTX A4000"
CUDA Driver Version / Runtime Version 12.3 / 12.1
CUDA Capability Major/Minor version number: 8.6
Total amount of global memory: 16376 MBytes (17174683648 bytes)
(048) Multiprocessors, (128) CUDA Cores/MP: 6144 CUDA Cores
GPU Max Clock rate: 1560 MHz (1.56 GHz)
Memory Clock rate: 7001 Mhz
Memory Bus Width: 256-bit
L2 Cache Size: 4194304 bytes
...
Result = PASS
Systeemvariabelen Controleren: Result = PASS
CUDA-monsterstest (facultatief, maar aanbevolen)
Laten we er een compileren en uitvoeren.
mkdir CudaTest
cd CudaTest
dotnet new console -n CudaTest
cd CudaTest
Compileer het(vereist Visual Studio):
dotnet add package Microsoft.ML.OnnxRuntime.Gpu # Latest version
Voer het uit.
Microsoft.ML.OnnxRuntimeU zou de uitvoer moeten zien als:Microsoft.ML.OnnxRuntime.GpuDe sleutelregelStap 5: Testen vanuit C#Program.cs:
using Microsoft.ML.OnnxRuntime;
using System;
using System.Linq;
namespace CudaTest
{
class Program
{
static void Main(string[] args)
{
Console.WriteLine("=== CUDA Test from C# ===\n");
// Test 1: Can we create a CUDA execution provider?
Console.WriteLine("Test 1: CUDA Execution Provider");
try
{
var cudaProviderOptions = new OrtCUDAProviderOptions();
var sessionOptions = new SessionOptions();
sessionOptions.AppendExecutionProvider_CUDA(cudaProviderOptions);
Console.WriteLine("✅ CUDA execution provider created successfully");
Console.WriteLine($" Device ID: {cudaProviderOptions.DeviceId}");
}
catch (Exception ex)
{
Console.WriteLine($"❌ Failed to create CUDA provider: {ex.Message}");
return;
}
// Test 2: Check available providers
Console.WriteLine("\nTest 2: Available Execution Providers");
var providers = OrtEnv.Instance().GetAvailableProviders();
foreach (var provider in providers)
{
Console.WriteLine($" - {provider}");
}
if (providers.Contains("CUDAExecutionProvider"))
{
Console.WriteLine("✅ CUDA provider is available");
}
else
{
Console.WriteLine("❌ CUDA provider NOT available");
}
// Test 3: Get CUDA device count and info
Console.WriteLine("\nTest 3: CUDA Device Information");
try
{
// ONNX Runtime doesn't expose deviceQuery directly,
// but we can test by trying to create a session
var opts = new SessionOptions();
opts.AppendExecutionProvider_CUDA(0); // Device 0
Console.WriteLine("✅ Successfully configured for CUDA device 0");
Console.WriteLine(" (Full device info requires native CUDA calls)");
}
catch (Exception ex)
{
Console.WriteLine($"❌ CUDA device configuration failed: {ex.Message}");
}
Console.WriteLine("\n=== Test Complete ===");
}
}
}
Nu het leuke gedeelte - laten we eigenlijk gebruiken CUDA van C#!:
Testproject aanmakenONNX-runtime toevoegen met CUDA
DeviceIdONNX-runtimeWaarom dit pakketje?- alleen CPU
AanmakenOpsplitsing van de code
dotnet run
Kan geheugenlimieten instellen, optimalisatieniveau, enz.:
=== CUDA Test from C# ===
Test 1: CUDA Execution Provider
✅ CUDA execution provider created successfully
Device ID: 0
Test 2: Available Execution Providers
- CUDAExecutionProvider
- CPUExecutionProvider
✅ CUDA provider is available
Test 3: CUDA Device Information
✅ Successfully configured for CUDA device 0
(Full device info requires native CUDA calls)
=== Test Complete ===
Als dit lukt, werkt CUDAAls het mislukt, iets in de stack is gebroken
OrtEnv.Instance().GetAvailableProviders():
# Make sure CUDA bin is in PATH
$env:PATH += ";C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\bin"
# Verify cudnn DLL exists
Test-Path "C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\bin\cudnn64_8.dll"
# Try running again
dotnet run
Moet bevatten "CUDAExecutionProvider" als alles correct is geïnstalleerdOok toont "CPUExecutionProvider" als terugval
Voer de test uit.:
dotnet remove package Microsoft.ML.OnnxRuntime
dotnet add package Microsoft.ML.OnnxRuntime.Gpu --version 1.16.3
Problemen met het oplossen van gemeenschappelijke foutenFout: "DllNotFoundException: kan DLL 'onnxruntime' niet laden"
OorzaakONNX Runtime kan geen CUDA DLL's vinden.
Fout: "CUDAExecutionProvider niet gevonden"
: Gebruik van verkeerde ONNX Runtime pakket (CPU-only).
# Download sample model
Invoke-WebRequest -Uri "https://github.com/onnx/models/raw/main/vision/classification/mnist/model/mnist-8.onnx" -OutFile "mnist.onnx"
Fout: "CUDA foutcode: 35 (CUDA driver versie is onvoldoende) "Program.cs:
using Microsoft.ML.OnnxRuntime;
using Microsoft.ML.OnnxRuntime.Tensors;
using System;
using System.Diagnostics;
using System.Linq;
namespace CudaTest
{
class Program
{
static void Main(string[] args)
{
Console.WriteLine("=== GPU vs CPU Inference Test ===\n");
// Create dummy input (28x28 image flattened to 784 floats)
var inputData = Enumerable.Range(0, 784).Select(i => (float)i / 784).ToArray();
var tensor = new DenseTensor<float>(inputData, new[] { 1, 1, 28, 28 });
var inputs = new List<NamedOnnxValue>
{
NamedOnnxValue.CreateFromTensor("Input3", tensor)
};
// Test 1: CPU Inference
Console.WriteLine("Test 1: CPU Inference");
var cpuTime = TestInference(inputs, useCuda: false, iterations: 100);
Console.WriteLine($" Average time: {cpuTime:F2}ms\n");
// Test 2: GPU Inference
Console.WriteLine("Test 2: GPU Inference");
var gpuTime = TestInference(inputs, useCuda: true, iterations: 100);
Console.WriteLine($" Average time: {gpuTime:F2}ms\n");
// Compare
Console.WriteLine("Comparison:");
Console.WriteLine($" CPU: {cpuTime:F2}ms");
Console.WriteLine($" GPU: {gpuTime:F2}ms");
Console.WriteLine($" Speedup: {cpuTime / gpuTime:F2}x faster on GPU");
}
static double TestInference(List<NamedOnnxValue> inputs, bool useCuda, int iterations)
{
var options = new SessionOptions();
if (useCuda)
{
options.AppendExecutionProvider_CUDA(0);
}
using var session = new InferenceSession("mnist.onnx", options);
// Warmup run (first run is always slower)
session.Run(inputs);
// Timed runs
var sw = Stopwatch.StartNew();
for (int i = 0; i < iterations; i++)
{
using var results = session.Run(inputs);
// Force evaluation
var output = results.First().AsEnumerable<float>().ToArray();
}
sw.Stop();
return sw.Elapsed.TotalMilliseconds / iterations;
}
}
}
Oorzaak:
**: Chauffeur is te oud voor CUDA 12.x.**Repareren
[1, 1, 28, 28]Geavanceerde test: werkelijke gevolgtrekking**Laten we iets echts doen - run een klein neuraal netwerk op GPU vs CPU en vergelijk snelheden.**Download een testmodel
InferentietestcodeBijwerken
DenseTensor- ONNX Runtime's manier om multidimensionale arrays te representeren
dotnet run
= batch_size=1, kanalen=1, hoogte=28, breedte=28NamedOnnxValue
=== GPU vs CPU Inference Test ===
Test 1: CPU Inference
Average time: 0.42ms
Test 2: GPU Inference
Average time: 0.15ms
Comparison:
CPU: 0.42ms
GPU: 0.15ms
Speedup: 2.80x faster on GPU
- Bindt een tensor naar een invoernaam
Tijdschema ✅ Driver installed correctly ✅ CUDA Toolkit accessible ✅ cuDNN integrated ✅ ONNX Runtime finds CUDA ✅ C# can run GPU-accelerated inference
Verwachte output
sequenceDiagram
participant App as C# Application
participant CPU as CPU Memory
participant GPU as GPU Memory
participant Compute as GPU Cores
App->>CPU: Create input tensor
CPU->>GPU: Transfer input (PCIe)
Note over GPU: Slow! ~16GB/s
GPU->>Compute: Execute model
Note over Compute: Fast! TFLOPS
Compute->>GPU: Write output
GPU->>CPU: Transfer output (PCIe)
Note over GPU: Slow again!
CPU->>App: Return results
(Uw nummers zullen variëren)::
graph TD
A[Inference Request] --> B{Model Size}
B -->|< 100MB| C{Batch Size}
B -->|> 100MB| D[Use GPU]
C -->|Single Item| E[Use CPU]
C -->|Batch > 10| D
D --> F[10-100x Faster]
E --> G[Lower Latency for Single]
class D,E choice
classDef choice stroke:#333,stroke-width:2px
Geheugenoverdracht Bottleneck:
Gegevens over GPU bewaren
CPU
nvidia-smi- Kleine modellen, enkele verzoeken, latency-kritieknvccVoor onze blog schrijven assistent:
Batch proces 100+ brokken → GPULLM-inferentie- Groot model (7B params) → GPU
Vector zoeken
Samenvatting
We hebben succes:
en
Onze ontwikkelomgeving is nu klaar voor AI workloads!
# Check GPU
nvidia-smi
# Check CUDA
nvcc --version
where.exe nvcc
# Check cuDNN
Test-Path "C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.1\bin\cudnn64_8.dll"
# Check environment
$env:CUDA_PATH
$env:PATH -split ';' | Select-String CUDA
# Test from C#
dotnet run
We duiken diep in inbeddingen en vectordatabases:
|-------|-------|-----|
| nvidia-smiWat zijn inbeddingen en hoe kunnen ze semantisch zoeken?
| nvccKiezen tussen Qdrant, pgvector en andere opties
Inbeddingen lokaal genereren met ONNX Runtime
Efficiënt opslaan en opvragen van miljoenen vectorenMicrosoft.ML.OnnxRuntime.Gpu |
Bouwen van ons eerste semantische zoekprototype
Referentie probleemoplossing |--------------|---------------|--------------|-----------------| Snelle kenmerkende commando's Gemeenschappelijke vraagstukken Fout in de oorzaak Fix
Deel 4: Bouwen van de Ingestie PijpleidingDeel 5: De Windows ClientDeel 6: Lokale LLM-integratie
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.