Cargando…
Cargando…
Especificación de los cuatro índices evaluativos de Tuwün: fórmula, umbrales, insumos, procedencia de cada componente y comportamiento ante datos faltantes.
Cada componente de este documento lleva una etiqueta de procedencia.
| Etiqueta | Definición |
|---|---|
| Calculado | Computado por código determinista. Reproducible a mano con la fórmula publicada. |
| Importado | Publicado por la fuente oficial y transportado sin transformación. |
| Curado | Compilado manualmente desde fuentes oficiales. Sin pipeline de refresco automático. |
| Modelo | Asignado por un modelo de lenguaje bajo rúbrica escrita, con revisión adversarial posterior. |
Los cuatro índices siguen el ciclo de efectividad del BID (diseño → ejecución → evaluación → transparencia).
| Índice | Escala | Cadencia | Insumos |
|---|---|---|---|
| Índice de Calidad del Gasto | 0–100 | Mensual | DIPRES, BIPS, MDSF, Presupuesto Abierto |
| Índice de Coincidencia | 0–100 | Semanal | CEP, corpus legislativo |
| Score DEM | 0–10 | Por análisis | Expediente del proyecto |
| Score de Evaluabilidad | 0–100 | Por ley | Texto de la ley, catálogo de indicadores |
Los indicadores territoriales (comunas, proveedores, seguridad, personas) no aplican este marco: no son evaluaciones. Se especifican en el documento II.
ejecucion_total_pct = Σ(monto_pagado) / Σ(presupuesto_vigente) × 100
ejecucion_total_clp = Σ(monto_pagado) del mes
delta_mom = ejecucion_pct[t] − ejecucion_pct[t−1] [pp]pct_ejecucion_mes = pagado_en_mes / presupuesto_vigente_anual × 100
pct_ejecucion_acum_anio = pagado_ytd / presupuesto_vigente_anual × 100
delta_mom = pct_ejecucion_mes[t] − pct_ejecucion_mes[t−1] [pp]Sin match del programa contra la fuente presupuestaria, los tres campos quedan en null. No se imputa.
ejecucion_total_pct mide velocidad de pago sobre presupuesto autorizado. No mide calidad de evaluación, cobertura ni resultado. Afirmaciones del tipo «X% obtiene resultados favorables» sobre este campo están declaradas como forbidden claim en el diccionario de datos y bloquean la publicación.
Numerador: Presupuesto Abierto (monto pagado). Denominador: DIPRES, ejecución presupuestaria (presupuesto vigente).
valor = round(
0.30 × pct_rs // Control de gestión
+ 0.25 × pct_epg_bueno // Evaluación cualitativa
+ 0.25 × ejecucion_total_pct // Ejecución presupuestaria
+ 0.20 × cobertura_promedio_regional // Cobertura territorial
)
pct_rs = % de iniciativas BIP con RATE = RS
pct_epg_bueno = 100 × bueno / (bueno + regular + malo)
cobertura = media de cobertura_pct sobre regiones| Dimensión | Peso | Definición operativa | Fuente |
|---|---|---|---|
| Control de gestión | 0.30 | Iniciativas con sistema de control de gestión vigente. Solo RATE = RS cuenta como vigente. Inspirado en relevancia. | BIP |
| Evaluación cualitativa | 0.25 | Programas calificados bueno en evaluación cualitativa oficial. Inspirado en efectividad. | EPG · DIPRES/MDSF |
| Ejecución presupuestaria | 0.25 | Ejecución sobre presupuesto autorizado, ponderada por tamaño. Inspirado en eficiencia. | DIPRES |
| Cobertura territorial | 0.20 | Cobertura promedio regional de los programas evaluados. Inspirado en sostenibilidad. | MDSF |
| Componente ausente | Valor asumido | Criterio |
|---|---|---|
| EPG (0 evaluados) | 50 | Neutral: la falta de evaluación no es evidencia negativa del programa. |
| Cobertura | 50 | Neutral. |
pct_rs | 0 | La ausencia de control de gestión es evidencia negativa. |
| Ejecución | 0 | La ausencia de pagos es evidencia negativa. |
| Los cuatro | null | No se publica índice. |
Referencia histórica del explainer: 58. delta_vs_mes_anterior se computa en pipeline contra el score persistido del período previo; no lo asigna el modelo.
Las cuatro dimensiones se inspiran en los criterios de evaluación de la banca multilateral (relevancia, efectividad, eficiencia, sostenibilidad), pero cada una mide un proxy operativo disponible en datos públicos chilenos y se nombra por lo que calcula —control de gestión, evaluación cualitativa, ejecución presupuestaria, cobertura territorial—, no por el criterio; la correspondencia es aproximada, no literal. El marco canónico pondera 20/40/20/20 (Relevancia · Efectividad · Eficiencia · Sostenibilidad, Cuadro 2.2 DEO 2024); Tuwün usa 30/25/25/20 y se desvía a propósito del peso de Efectividad: el marco le asigna 40%, pero el proxy de Tuwün —evaluación cualitativa vía EPG— pesa solo 25%, porque para programas en operación continua la efectividad observada es rezagada y parcial, mientras que el control de gestión (RATE) es la señal más temprana disponible y condición previa a cualquier evaluación de impacto; de ahí que Relevancia suba a 30% frente al 20% del marco canónico. La validación empírica del re-peso está pendiente (§ Límites, documento II).
Buckets del Banco Integrado de Proyectos, copiados verbatim del registro oficial. Prohibido recomputar pct_rs.
| Bucket | Definición |
|---|---|
| RS | Recomendable Satisfactoriamente. Habilitado para postular a financiamiento. |
| FI | Falta Información. Antecedentes incompletos. |
| OT | Objetada Técnicamente. |
| IN | Incumple Normativa. |
total = rs_count + fi_count + ot_count + in_count
por ministerio:
total_iniciativas == 0 ⟹ pct_rs == 0
|pct_rs − round(100 × rs_count / total_iniciativas)| ≤ 1.0 ppBIP (sin S): proyectos de inversión; son los que llevan tarjeta RATE. BIPS (con S): programas en operación. La confusión está declarada como forbidden claim.
El veredicto no se computa: se mapea desde la evaluación oficial.
| Veredicto | Origen |
|---|---|
| bueno | Buen Desempeño + Resultados Positivos |
| regular | Desempeño Medio + Resultados Positivos Parciales + Resultados Mixtos |
| malo | Desempeño Bajo + Mal Desempeño + Resultados Negativos |
| sin_eval | Resultados No Identificados · «No aplica» · sin match |
Cruce programa→veredicto: matching case-insensitive con substring tolerado. Sin match ⟹ sin_eval. No se imputa nota.
costo_per_capita_clp = presupuesto_anual_clp / beneficiarios_efectivos
cobertura_pct = 100 × beneficiarios_efectivos / poblacion_objetivo
denominador 0 o null ⟹ nullnivel = critico si cobertura_pct < 40
bajo si cobertura_pct < 60
ok si cobertura_pct ≥ 60Los valores de cobertura_pct de este bloque son estimación del equipo, no medición CASEN oficial. El fixture lo declara como methodology_version: analyst_judged. Alimenta la dimensión Cobertura territorial (0.20) del Índice de Calidad del Gasto.
Distancia L1 entre el vector de prioridades ciudadanas (CEP, 12 temas) y el vector temático del corpus legislativo vivo. Computado en Python; el valor del modelo se sobrescribe.
sum_c = Σ vector_congreso
sum_z = Σ vector_ciudadania
L1 = Σ_t | congreso[t]/sum_c × 100 − ciudadania[t]/sum_z × 100 |
IC = round(100 − L1 / 2, 1)| Condición | Salida |
|---|---|
| Claves de ambos vectores no coinciden | Error (aborta) |
sum_c ≤ 0 o sum_z ≤ 0 | 0.0 |
| Proporcionalidad exacta | 100 |
Cada vector se normaliza contra su propia suma. La CEP es de respuesta múltiple (suma ≈ 220); el vector congreso cubre parte del corpus (suma ≈ 58). Sin normalizar, L1 ≈ 162 y 100 − L1/2 cae en negativo. Normalizados, L1 tiene techo 200 e IC queda acotado en [0, 100].
No mide leyes aprobadas, velocidad de tramitación ni calidad legislativa. Mide únicamente similitud de composición temática. Declarado en el diccionario de datos con rango típico 30–90.
La serie histórica se recalcula con la fórmula vigente mediante job de recómputo; delta_ic_semana_anterior = IC[t] − IC[t−1].
pct_congreso = n_boletines_del_tema / boletines_vivos × 100 // denominador: corpus vivo
deficit_pp = pct_ciudadania − pct_congreso // 2 decimales
// positivo ⟹ sub-representación
brecha_critica ⟺ |deficit_pp| ≥ 30 ppEl vector congreso no suma 100: son proporciones sobre el corpus vivo completo, no sobre lo movido en la semana. Sin snapshot de corpus, el cálculo cae a los boletines del Scout (suma 100) y se emite aviso en hallazgos.
brechas_criticas_count == count(t ∈ matriz_temas : |t.deficit_pp| ≥ 30)El listado brechas_criticas_temas excluye la categoría «Otros» y ordena por magnitud absoluta descendente.
corte = cierre del viernes de la semana ISO
vivo ⟺ fecha_ingreso ≤ corte ∧ estado ∉ estados_terminales
durmiente ⟺ (corte − ultimo_tramite) ≥ 180 días
durmientes_pct = durmientes_count / boletines_vivos × 100
top_durmientes = 12 con mayor dias_sin_movimiento
reactivado ⟺ durmiente que registra movimiento dentro de la ventanaEl snapshot es determinista (SQL + Python). Si falla, la corrida aborta: sin snapshot, pct_congreso usaría un denominador incorrecto.
Criterio distinto del snapshot: se filtran los temas con deficit_pp > 30 y se ordena por (dias_sin_movimiento DESC, deficit_pp DESC), máximo 12.
Ventana móvil de 30 días previos al corte. tema_mas_activo_pct se calcula sobre el total de movidos en la ventana, no sobre la semana. Campo nulo si el Scout no enriqueció la ventana.
dem_score = round(0.20 × relevancia + 0.40 × efectividad + 0.20 × eficiencia + 0.20 × sostenibilidad, 1)
badge: ≥ 7.0 aprobado
≥ 5.0 en el límite
< 5.0 rechazado
weakest_criterion = argmin de las cuatro dimensionesAgregación: promedio ponderado — Relevancia 20% · Efectividad 40% · Eficiencia 20% · Sostenibilidad 20% (Cuadro 2.2, DEO 2024 del BID). El peso mayor de Efectividad refleja el énfasis del marco multilateral en si la intervención logra lo que promete.
Las cuatro dimensiones las asigna el agente Analyst bajo rúbrica escrita. Es el único componente publicado cuyo valor proviene de un juicio y no de una operación aritmética; de ahí el control adversarial que sigue.
| Regla | Efecto |
|---|---|
| Recalificación independiente | El agente Critic recalifica las cuatro dimensiones sin ver la justificación del Analyst. |
|total_critic − total_analyst| > 1.0 | La calificación del Critic reemplaza a la original. |
| Criterio < 6.0 | Obliga a citar textualmente (≤ 280 caracteres) el pasaje que lo sustenta. |
Escala legacy: valores persistidos sobre 10 se normalizan dividiendo por 10 al leerse.
Mide si una ley promulgada admite evaluación de impacto. No mide impacto.
| Componente | Peso | Cómputo |
|---|---|---|
| Disponibilidad de línea base | 0.30 | Media de peso_linea_base(i) sobre los indicadores de resultado. Sin indicadores de resultado ⟹ 0.0 (no null). |
| Metas de resultado definidas | 0.15 | Media de indicadores de resultado con meta declarada — valor y año objetivo. Sin meta declarada ⟹ 0.0 para ese indicador. |
| Calidad de indicadores | 0.12 | Media de checks cumplidos por indicador: SMART completo · fuente en catálogo · nivel declarado. |
| Teoría del cambio | 0.20 | 100 × cumplidos / 6: objetivo, mecanismo causal, problema público, población objetivo, ≥1 instrumento, supuestos con riesgo. |
| Identificabilidad | 0.15 | Tabla por tipo de variación (abajo). |
| Trazabilidad de fuentes | 0.08 | % de indicadores con fuente declarada y acceso no restringido. |
computables = componentes con valor ≠ null
peso_efectivo(c) = PESO_BASE(c) / Σ PESO_BASE(computables)
composite = Σ valor(c) × peso_efectivo(c)La disponibilidad de línea base nunca es null: su ausencia devuelve 0.0 y por tanto no participa de la renormalización (ver §13, defecto 1).
| Estado | Ventana pre-vigencia | Peso |
|---|---|---|
| capturada | ≤ 90 días | 1.00 |
| capturada | ≤ 365 días | 0.70 |
| capturada | > 365 días | 0.40 |
| capturada | sin declarar | 0.40 |
| estimada | — | 0.40 |
| no disponible | — | 0.00 |
| cero por construcción | — | 0.00 |
| Tipo de variación | Condición | Valor |
|---|---|---|
| Por umbral | — | 100 |
| Escalonado geográfico / por grupo | ≥ 2 tramos fechados y ≥ 1 grupo | 85 |
| Escalonado geográfico / por grupo | en otro caso | 40 |
| Escalonado temporal | ≥ 1 tramo fechado | 70 |
| Escalonado temporal | en otro caso | 40 |
| Simultáneo | — | 20 |
| No declarado | — | 20 (cayó a default) |
≥ 75 evaluable
60 – 74 evaluable con reservas
< 60 no evaluable aún
núcleo vacío → sin datos (valor = null; no se computa score)
PISO: sin ningún indicador de resultado ⟹ estado = no_evaluable_aun,
cualquiera sea el valor numérico.Justificación del piso: con línea base en 0 el techo aritmético es 70, suficiente para evaluable con reservas. Una ficha que no mide resultados no puede llevar esa etiqueta.
Restricción de schema: el estado cero_por_construccion se rechaza en indicadores de nivel resultado.
Todo cambio de cálculo obliga a incrementar formula_version; un validador bloquea la edición sin bump. Los puntajes publicados se congelan con la versión con que se calcularon.
| # | Versión | Defecto corregido |
|---|---|---|
| 1 | 2.0 | Incentivo perverso. La ausencia de indicadores de resultado devolvía null y su peso 0.30 se redistribuía. Omitirlos subía el score (caso 20.850: 57 → 82). Corrección: la ausencia devuelve 0.0 y no renormaliza. |
| 2 | 2.0 | Cero tautológico. cero_por_construccion sobre conteos de producto capturaba el 30% completo sin medir resultado alguno. Corrección: peso 0.00 y rechazo en schema para niveles de resultado. |
| 3 | 2.0 | Piso de estado. Sin indicadores de resultado, el techo 70 permitía la etiqueta evaluable con reservas. Corrección: estado forzado a no evaluable aún. |
| 4 | 2.0 | Acantilado a 365 días. Toda ventana > 365 d caía a 0.00, anulando mediciones reales (caso 21.735: ventanas de 397 d, −6 puntos). Corrección: tramos completos, cola en 0.40. |
| 5 | 2.1 | Castigo al calendario ajeno. El tramo 0.20 sobre 730 d hacía que una medición real valiera la mitad que una estimación (0.40), premiando el etiquetado incorrecto. Corrección: cola estabilizada en 0.40. No altera puntajes vigentes (21.735 = 76; 20.850 = 57). |
| 6 | 2.2 | Metas de resultado sin exigencia. El score premiaba declarar un indicador de resultado con línea base capturada sin exigir que la ley fijara una meta —valor y año objetivo— contra la cual juzgar el avance. Corrección: nuevo componente Metas de resultado definidas (peso 0.15); pesos re-balanceados a 30/15/12/20/15/8 (línea base, metas de resultado, calidad de indicadores, teoría del cambio, identificabilidad, trazabilidad de fuentes). |