ttnn.transformer.attention_softmax_
- ttnn.transformer.attention_softmax_(input_tensor: ttnn.Tensor, *, memory_config: ttnn.MemoryConfig = None, head_size: int = None, attention_mask: ttnn.Tensor = None, program_config: SoftmaxProgramConfig = SoftmaxDefaultProgramConfig(), causal_mask: bool = false) ttnn.Tensor
-
In-Place divides
tensorby the square root ofhead_size, addsattention_mask(optionally) and computes softmax.- Parameters:
-
input_tensor (ttnn.Tensor)the input tensor.
- Keyword Arguments:
-
memory_config (ttnn.MemoryConfig, optional)Memory configuration for the operation. Defaults to None.
head_size (int, optional)Number of heads. Defaults to None.
attention_mask (ttnn.Tensor, optional)Attention Mask. Defaults to None.
program_config (SoftmaxProgramConfig)Program Config of the output tensor. Defaults to SoftmaxDefaultProgramConfig().
causal_mask (bool, optional)the attention mask is causal. Defaults to false.
- Returns:
-
ttnn.Tensorthe output tensor.