Inference & performance · Concept
Tensor parallelism
Split operations within model layers across multiple devices.
Related terms
Primary references
Reference definition
Inference & performance · Concept
Split operations within model layers across multiple devices.
Reference definition