HabanaAI · kzawora-intel · Sep 9, 2024 · Aug 26, 2024 · Aug 27, 2024 · Aug 29, 2024
@@ -30,8 +30,7 @@ def reshape_and_cache(key,
     # lots of padding, or are doing warmup.
     # This loop is a workaround for this issue. Please remove it
     # once key_cache.index_put_(indices, offsets), key) works.
-    num_kv_cache_passes = torch.div(num_slots_requested,
-                                    num_slots_available).ceil().int().item()
+    num_kv_cache_passes = -(-num_slots_requested // num_slots_available)
     for i in range(num_kv_cache_passes):
         start_idx = i * num_slots_available
         end_idx = (i + 1) * num_slots_available
@@ -58,8 +57,7 @@ def prepare_to_cache(cache, slot_mapping):
     # lots of padding, or are doing warmup.
     # This loop is a workaround for this issue. Please remove it
     # once key_cache.index_put_(indices, offsets), key) works.
-    num_kv_cache_passes = torch.div(num_slots_requested,
-                                    num_slots_available).ceil().int().item()
+    num_kv_cache_passes = -(-num_slots_requested // num_slots_available)
 
     return num_kv_cache_passes, num_slots_available, indices, offsets
 

@@ -44,6 +44,7 @@
 
 from .interfaces import SupportsLoRA
 
+is_hpu = current_platform.is_hpu()
 
 class GPTBigCodeAttention(nn.Module):
 
@@ -225,13 +226,13 @@ def forward(
         position_embeds = self.wpe(position_ids)
         hidden_states = inputs_embeds + position_embeds
 
-        if current_platform.is_hpu():
+        if is_hpu:
             import habana_frameworks.torch as htorch
             htorch.core.mark_step()
         for i in range(len(self.h)):
             layer = self.h[i]
             hidden_states = layer(hidden_states, kv_caches[i], attn_metadata)
-            if current_platform.is_hpu():
+            if is_hpu:
                 htorch.core.mark_step()
 
         hidden_states = self.ln_f(hidden_states)

@@ -55,6 +55,7 @@
 from .interfaces import SupportsLoRA
 from .utils import PPMissingLayer, is_pp_missing_parameter, make_layers
 
+is_hpu = current_platform.is_hpu()
 
 class LlamaMLP(nn.Module):
 
@@ -318,7 +319,7 @@ def forward(
             hidden_states = intermediate_tensors["hidden_states"]
             residual = intermediate_tensors["residual"]
 
-        if current_platform.is_hpu():
+        if is_hpu:
             import habana_frameworks.torch as htorch
             htorch.core.mark_step()
         for i in range(self.start_layer, self.end_layer):
@@ -330,7 +331,7 @@ def forward(
                 attn_metadata,
                 residual,
             )
-            if current_platform.is_hpu():
+            if is_hpu:
                 htorch.core.mark_step()
 
         if not get_pp_group().is_last_rank: