<?xml version="1.0" encoding="utf-8" standalone="yes"?><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/i-the-language/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/i-why-gpus/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/i-why-observability/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/01-anatomy/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/ii-data-in-memory/01-arrays-and-slices/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/v-performance/01-benchmarking-and-profiling/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/01-cpu-architecture/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/ii-data-in-memory/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/01-go-in-the-ai-stack/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iv-concurrency/01-goroutines-and-the-scheduler/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/01-gpu-architecture/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vii-datacenter-and-frontier/01-gpu-generations/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/01-reading-papers/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/ii-inside-the-chip/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vi-multi-gpu-and-sharing/01-interconnects-and-topology/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iii-programming-model/01-kernels-threads-blocks-grids/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/v-gpus-for-ai/01-matmul-on-a-gpu/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/ii-metrics/01-metric-types/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/ii-metrics/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/i-why-observability/01-monitoring-vs-observability/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/01-mqa-gqa-mla/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/01-optimization-methodology/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/01-control-vs-data-plane/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/01-numpy-inference-engine/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/01-slos-and-budgets/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/ii-inside-the-chip/01-sms-warps-simt/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iii-memory/01-stack-and-heap/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iii-logs-traces-profiles/01-structured-logs-and-wide-events/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/01-methodology/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iv-performance/01-roofline/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iv-running-it/01-the-telemetry-pipeline/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/vi-tools-and-frontier/01-the-tool-landscape/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/01-forward-pass-trace/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/01-transformer-inference-overview/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/01-vectors-and-matrices/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/i-why-gpus/01-what-is-a-gpu/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/v-ai-infrastructure/01-what-is-different/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/01-what-is-inference/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/01-why-distribute/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/i-the-language/01-why-go-and-the-toolchain/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/02-apis/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/02-attention-research/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/02-caches-and-memory-hierarchy/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/02-capacity-planning/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iv-concurrency/02-channels/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/02-graphs-and-operators/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iv-running-it/02-dashboards/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/02-data-parallelism/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iii-logs-traces-profiles/02-distributed-tracing/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iii-memory/02-escape-analysis/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/02-execution-model/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/v-ai-infrastructure/02-gpu-telemetry/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/vi-tools-and-frontier/02-how-it-is-changing/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/ii-metrics/02-instrumenting-a-go-service/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/i-why-gpus/02-latency-vs-throughput/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iii-logs-traces-profiles/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/02-matmul-by-hand/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iii-memory/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iv-performance/02-memory-access-patterns/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/02-mixture-of-experts/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/02-model-registry/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vii-datacenter-and-frontier/02-other-accelerators/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/v-gpus-for-ai/02-precision-and-quantization/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/02-cpu-matmul-benchmark/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/02-quantization-overview/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vi-multi-gpu-and-sharing/02-splitting-work/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/ii-data-in-memory/02-strings-bytes-and-runes/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/02-tensors-and-matmul/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/v-performance/02-the-compiler/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/ii-inside-the-chip/02-memory-hierarchy/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iii-programming-model/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/02-roofline-in-practice/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/i-why-observability/02-the-signals/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/02-tokenization/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/02-training-vs-inference/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/i-the-language/02-values-types-and-zero-values/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iii-programming-model/02-first-kernel-from-go/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/03-a-neural-network-from-scratch/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iv-running-it/03-alerting-on-slos/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/v-performance/03-cache-friendly-data/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iv-concurrency/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/03-cost-per-token/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/i-why-gpus/03-from-pixels-to-tensors/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/i-the-language/03-functions-errors-and-defer/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/03-gemm-and-gemv/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/03-memory-hierarchy/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/ii-inside-the-chip/03-hbm-and-bandwidth/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iii-programming-model/03-host-and-device-memory/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/v-ai-infrastructure/03-inference-engine-metrics/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/03-kubernetes-for-gpus/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/03-kv-cache-research/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/ii-data-in-memory/03-maps/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/v-gpus-for-ai/03-memory-planning-for-llms/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/03-memory-vs-compute-bound/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/03-model-anatomy/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/03-moe-serving/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iv-performance/03-occupancy-and-divergence/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iii-logs-traces-profiles/03-opentelemetry/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iv-performance/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/03-prefill-vs-decode/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/03-first-gpu-kernel/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/ii-metrics/03-promql-essentials/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/03-queues-and-admission/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vii-datacenter-and-frontier/03-racks-power-and-cost/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/03-ram-and-numa/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iv-running-it/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iv-concurrency/03-select-context-and-cancellation/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vi-multi-gpu-and-sharing/03-sharing-one-gpu/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/i-why-observability/03-slis-slos-error-budgets/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/03-tensor-parallelism/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/03-tensors-shapes-broadcasting/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iii-memory/03-the-allocator/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/03-gptq-and-awq/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/vi-tools-and-frontier/03-what-to-watch/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/04-a-tokenizer/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/04-activation-quantization/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/v-ai-infrastructure/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iii-programming-model/04-async-and-streams/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/04-autoregressive-generation/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/04-autoscaling/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/04-bandwidth-and-roofline/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/04-batching-in-servers/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/v-performance/04-cgo-simd-and-assembly/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/04-convolutions/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/vi-tools-and-frontier/04-designing-for-an-inference-platform/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/04-scheduling-and-placement/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/04-gpu-utilization-myths/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/v-gpus-for-ai/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vi-multi-gpu-and-sharing/04-gpus-in-kubernetes/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/ii-metrics/04-histograms/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iv-performance/04-launch-overhead-and-fusion/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/04-long-context/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/04-neural-networks-from-scratch/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/i-why-observability/04-percentiles-and-tails/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/v-performance/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/04-pipeline-parallelism/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/ii-data-in-memory/04-pointers-and-struct-layout/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iii-logs-traces-profiles/04-profiling-and-ebpf/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/04-tiny-transformer/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/04-quantization-research/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/i-why-gpus/04-reading-a-spec-sheet/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iv-running-it/04-sampling-and-cost/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/04-simd-and-vectorization/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/i-the-language/04-structs-methods-and-interfaces/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iv-concurrency/04-sync-and-atomics/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/ii-inside-the-chip/04-tensor-cores-and-formats/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/04-tensors-and-forward-pass/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iii-memory/04-the-garbage-collector/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/v-ai-infrastructure/04-tracing-llm-requests/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/v-gpus-for-ai/04-training-vs-inference/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vii-datacenter-and-frontier/04-where-this-is-going/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/05-a-transformer-forward-pass/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/05-activations/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/05-backpressure-timeouts-retries/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/ii-metrics/05-cardinality/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/05-chunked-prefill/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/iv-running-it/05-debugging-an-incident/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/05-decoding-research/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/05-expert-parallelism/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/05-fault-tolerance/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/05-fp8-and-int8/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/ii-data-in-memory/05-interfaces-under-the-hood/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/05-kernel-launch-host-device/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/05-latency-throughput-metrics/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iv-performance/05-measuring-a-gpu/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/05-fragmentation-and-allocators/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vi-multi-gpu-and-sharing/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/05-multi-tenancy/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/v-performance/05-networking-and-the-netpoller/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/05-normalization/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/i-the-language/05-packages-modules-and-testing/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/v-ai-infrastructure/05-platform-and-fleet/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/ii-inside-the-chip/05-power-heat-host-link/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/05-kv-cache/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/05-kv-cache/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iv-concurrency/05-the-memory-model-and-data-races/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/iii-programming-model/05-software-stack/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/05-threads-processes-context-switching/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/vi-tools-and-frontier/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iii-memory/05-writing-allocation-aware-code/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/06-attention-computation/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/06-batching-basics/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/06-calling-llms/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/iv-concurrency/06-concurrency-patterns/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/v-ai-infrastructure/06-cost-power-efficiency/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/vii-datacenter-and-frontier/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/06-disaggregation/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/06-embeddings/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/ii-data-in-memory/06-generics-and-iterators/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/06-int4-and-low-bit/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/06-kv-cache-math/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/06-load-balancing/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/06-memory-allocation-virtual-memory/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/06-moe-research/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/06-multi-region-dr/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/06-oom/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/06-llm-inference-server/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/06-routing/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/06-sequence-context-parallelism/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/06-streams-and-sync/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/07-autoscaling-cold-starts/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/07-benchmarking/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/07-collectives-and-nccl/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/07-compute-vs-memory/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/07-context-length/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/07-cuda-graphs/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/07-embeddings-and-vector-search/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/07-fusion/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/07-kv-offloading/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/07-long-context-research/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/07-model-rollouts/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/07-prefix-aware-routing/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/07-dynamic-batching/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/v-ai-infrastructure/07-quality-and-evals/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/07-softmax-and-stability/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/07-storage-and-model-loading/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/07-tensor-layouts/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/08-attention-from-first-principles/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/08-static-and-dynamic-batching/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/08-cuda-graphs-in-serving/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/08-cuda-programming/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/08-flops-bandwidth-arithmetic-intensity/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/08-nsight-profiling/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/08-gateways/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/08-interconnects/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/08-kernels-and-launches/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/08-model-lifecycle/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/08-networking-fundamentals/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/08-observability/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/08-continuous-batching/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/08-scheduling-priorities/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/08-systems-research/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/08-serving-models-from-go/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/vi-ai-in-go/09-a-tool-calling-loop/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/09-cascades-and-fallbacks/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/09-coalescing/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/09-communication-cost-math/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/09-continuous-batching/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/09-cpu-python-profiling/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/09-cpu-vs-gpu/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/09-multi-model-serving/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/09-nvidia-trends/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/09-operator-fusion/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/09-pcie-dma-interconnects/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/09-kv-cache-manager/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/09-security-isolation/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/09-speculative-variants/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/09-tensorrt/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/09-the-transformer/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/10-abuse-and-quotas/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/10-alternative-accelerators/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/10-cluster-management/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/10-flashattention/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/10-graph-optimization/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/10-low-bit-fp4/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/10-metrics-and-dashboards/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/10-multi-node/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/10-occupancy-and-divergence/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/10-os-scheduling/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/10-paged-attention/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/10-quantized-inference/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/10-training-vs-inference-math/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/10-versioning-canary-ab/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/10-why-inference-is-different/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/11-platform-roadmap/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/x-memory-and-performance/11-case-studies/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/11-distributed-kv-cache/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xii-inference-platform-engineering/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/11-kv-cache-optimization/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/11-linux-for-inference-engineers/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/11-memory-centric/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/11-number-formats/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/11-prefix-caching/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/11-gpu-benchmark-suite/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xi-production-inference/11-scenario-design/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/11-static-vs-dynamic-shapes/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/11-tensor-cores/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/11-triton-kernels/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/11-vllm-architecture/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/i-fundamentals/11-why-inference-is-expensive/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiii-advanced-llm-inference/12-compilers/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/12-containers-namespaces-cgroups/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/12-kv-cache-quantization/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iv-neural-network-inference/12-numerical-precision-practice/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vi-gpu-computing/12-profiling-cuda/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/12-inference-gateway/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/iii-ml-fundamentals/12-quantization-fundamentals/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/12-sglang-architecture/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/12-speculative-decoding/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ix-distributed-inference/12-when-more-gpus-hurt/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/13-multi-gpu-inference/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/xiv-research-and-frontier/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/13-sampling/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/13-speculative-decoding-practice/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/ii-computer-systems/13-syscalls-and-profiling-basics/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/13-tgi-triton-onnxruntime/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/viii-serving-systems/14-choosing-a-stack/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/14-distributed-inference/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/vii-inference-optimization/14-pruning-distillation/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/14-streaming/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/v-llm-inference/15-capacity-math/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/15-mini-inference-platform/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/glossary/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/glossary/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/glossary/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/glossary/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/gpu-hardware/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/progress/</loc></url><url><loc>https://infra.pidoku.co.in/go-engineering/projects/</loc></url><url><loc>https://infra.pidoku.co.in/gpu-engineering/projects/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/projects/</loc></url><url><loc>https://infra.pidoku.co.in/observability-engineering/projects/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/resources/</loc></url><url><loc>https://infra.pidoku.co.in/inference-engineering/roadmap/</loc></url><url><loc>https://infra.pidoku.co.in/</loc></url></urlset>