memory : correctly handle failure in apply() (#14438)

ggerganov · web-flow · commit 745f11fed09b · 2025-06-30T18:03:03.000+03:00
ggml-ci
diff --git a/src/llama-kv-cache-unified-iswa.cpp b/src/llama-kv-cache-unified-iswa.cpp
@@ -246,7 +246,7 @@ bool llama_kv_cache_unified_iswa_context::next() {
 }
 
 bool llama_kv_cache_unified_iswa_context::apply() {
-    assert(status == LLAMA_MEMORY_STATUS_SUCCESS);
+    assert(!llama_memory_status_is_fail(status));
 
     bool res = true;
 
diff --git a/src/llama-kv-cache-unified.cpp b/src/llama-kv-cache-unified.cpp
@@ -1776,7 +1776,7 @@ bool llama_kv_cache_unified_context::next() {
 }
 
 bool llama_kv_cache_unified_context::apply() {
-    assert(status == LLAMA_MEMORY_STATUS_SUCCESS);
+    assert(!llama_memory_status_is_fail(status));
 
     // no ubatches -> this is a KV cache update
     if (ubatches.empty()) {
diff --git a/src/llama-memory-hybrid.cpp b/src/llama-memory-hybrid.cpp
@@ -218,7 +218,7 @@ bool llama_memory_hybrid_context::next() {
 }
 
 bool llama_memory_hybrid_context::apply() {
-    assert(status == LLAMA_MEMORY_STATUS_SUCCESS);
+    assert(!llama_memory_status_is_fail(status));
 
     bool res = true;
 
diff --git a/src/llama-memory-recurrent.cpp b/src/llama-memory-recurrent.cpp
@@ -1071,7 +1071,15 @@ bool llama_memory_recurrent_context::next() {
 }
 
 bool llama_memory_recurrent_context::apply() {
-    assert(status == LLAMA_MEMORY_STATUS_SUCCESS);
+    assert(!llama_memory_status_is_fail(status));
+
+    // no ubatches -> this is an update
+    if (ubatches.empty()) {
+        // recurrent cache never performs updates
+        assert(status == LLAMA_MEMORY_STATUS_NO_UPDATE);
+
+        return true;
+    }
 
     mem->find_slot(ubatches[i_next]);
 
diff --git a/src/llama-memory.cpp b/src/llama-memory.cpp
@@ -40,3 +40,20 @@ llama_memory_status llama_memory_status_combine(llama_memory_status s0, llama_me
     // if either status has an update, then the combined status has an update
     return has_update ? LLAMA_MEMORY_STATUS_SUCCESS : LLAMA_MEMORY_STATUS_NO_UPDATE;
 }
+
+bool llama_memory_status_is_fail(llama_memory_status status) {
+    switch (status) {
+        case LLAMA_MEMORY_STATUS_SUCCESS:
+        case LLAMA_MEMORY_STATUS_NO_UPDATE:
+            {
+                return false;
+            }
+        case LLAMA_MEMORY_STATUS_FAILED_PREPARE:
+        case LLAMA_MEMORY_STATUS_FAILED_COMPUTE:
+            {
+                return true;
+            }
+    }
+
+    return false;
+}
diff --git a/src/llama-memory.h b/src/llama-memory.h
@@ -31,6 +31,9 @@ enum llama_memory_status {
 // useful for implementing hybrid memory types (e.g. iSWA)
 llama_memory_status llama_memory_status_combine(llama_memory_status s0, llama_memory_status s1);
 
+// helper function for checking if a memory status indicates a failure
+bool llama_memory_status_is_fail(llama_memory_status status);
+
 // the interface for managing the memory context during batch processing
 // this interface is implemented per memory type. see:
 //   - llama_kv_cache_unified_context

Original file line number	Diff line number	Diff line change
`@@ -246,7 +246,7 @@ bool llama_kv_cache_unified_iswa_context::next() {`
`246`	`246`	`}`
`247`	`247`
`248`	`248`	`bool llama_kv_cache_unified_iswa_context::apply() {`
`249`		`- assert(status == LLAMA_MEMORY_STATUS_SUCCESS);`
	`249`	`+ assert(!llama_memory_status_is_fail(status));`
`250`	`250`
`251`	`251`	`bool res = true;`
`252`	`252`
Original file line number	Diff line number	Diff line change
`@@ -1776,7 +1776,7 @@ bool llama_kv_cache_unified_context::next() {`
`1776`	`1776`	`}`
`1777`	`1777`
`1778`	`1778`	`bool llama_kv_cache_unified_context::apply() {`
`1779`		`- assert(status == LLAMA_MEMORY_STATUS_SUCCESS);`
	`1779`	`+ assert(!llama_memory_status_is_fail(status));`
`1780`	`1780`
`1781`	`1781`	`// no ubatches -> this is a KV cache update`
`1782`	`1782`	`if (ubatches.empty()) {`
Original file line number	Diff line number	Diff line change
`@@ -218,7 +218,7 @@ bool llama_memory_hybrid_context::next() {`
`218`	`218`	`}`
`219`	`219`
`220`	`220`	`bool llama_memory_hybrid_context::apply() {`
`221`		`- assert(status == LLAMA_MEMORY_STATUS_SUCCESS);`
	`221`	`+ assert(!llama_memory_status_is_fail(status));`
`222`	`222`
`223`	`223`	`bool res = true;`
`224`	`224`