Observabilidad P8 mediante evento CUDA
Un evento CUDA sin timing reduce coste frente a cudaStreamSynchronize manteniendo ~20 ms de observación.
El trabajo diagnóstico, el álgebra exacta y las capacidades locales no equivalen a una ventaja minera extremo a extremo.
Qué se probó
Un evento CUDA sin timing reduce coste frente a cudaStreamSynchronize manteniendo ~20 ms de observación.
Por qué la prueba es relevante
Eventos y sync de stream usan rutas distintas; el ahorro debe replicar entre headers y retener el baseline sin sync.
R_ES=throughput(event-sync)/throughput(stream-sync)retención=throughput(event-sync)/throughput(P8-S0)selección exige R_ES>1 consistenteCómo se probó
Comparar P8-S0, stream-sync y event-sync sin timing en cuatro headers/24 corridas con SHA-256d intacto.
Qué ocurrió
Event/stream 1,000022×, IC95 0,999696–1,000347, favorable sólo 1/4. Retuvo 0,999572 de S0 y observó cada 0,020270 s.
Controles de exactitud y estadísticos
B32, 44 registros, cero spills y factores exactos en los tres binarios.
Qué significa
El evento no reduce reproduciblemente el coste. El siguiente mecanismo debe sincronizar menos veces.
Limitaciones
- Sólo evento sin timing.
- Intervalo compatible con igualdad.
- No justifica campaña energética.
Trazabilidad
Reconstruir los tres binarios y repetir igual trabajo; no seleccionar por el punto.
Variantes canónicas
CANONICAL-EXP-159PREREGISTERED-CAMPAIGNSEALED-AUDITFuente: informes canónicos auditados internamente. Se excluyen las rutas locales, cabeceras privadas e identificadores operativos.