Extracción de Conocimiento Dirigida por Datos

Un libro técnico te da consejos. Este proyecto los convierte en algo que se puede comprobar.

kdd-book lee un libro o una guía técnica y separa cada consejo en tres categorías honestas: lo que una computadora puede verificar automáticamente, lo que es una técnica real pero exige criterio humano, y lo que es simplemente conocimiento de fondo. Después construye, para cada pieza verificable, un chequeo automático y un ejercicio práctico con solución.

El problema

Leer un libro técnico no significa que lo aplicaste bien

Un libro de buenas prácticas te dice qué hacer. Pero nadie te dice, mientras escribís código, si de verdad lo estás cumpliendo — hasta que alguien más revisa tu trabajo, o hasta que el error ya está en producción.

01

El consejo es texto

"Nombrá tus variables con claridad." "No repitas código." Son ideas correctas, pero ninguna computadora las entiende tal como están escritas.

02

No todo se puede medir

Algunos consejos tienen una regla clara y comprobable. Otros dependen del contexto y del juicio de quien programa. Tratarlos igual es el error más común.

03

Nadie practica con feedback real

Sin un chequeo automático, "practicar" un libro es solo releerlo. kdd-book construye el ejercicio y el corrector para cada técnica que sí se puede comprobar.

Cómo funciona

Tres pasos, sin atajos

El mismo método se aplicó, hasta ahora, a 15 fuentes distintas — desde guías de estilo hasta especificaciones técnicas y hasta textos puramente filosóficos.

Extraer el grafo

Cada idea del libro se convierte en un nodo de conocimiento: un título, una descripción y de dónde salió. Nada se inventa — todo se puede rastrear hasta el texto original.

Clasificar con honestidad

Cada nodo recibe una de tres etiquetas: medible (hay una regla clara), criterio (es real pero no tiene un umbral binario) o conocimiento (contexto, no una técnica).

Verificar de verdad

Para cada técnica medible se escribe un instrumento que la comprueba en segundos, y un ejercicio con una versión rota y una versión correcta — probando que el instrumento distingue entre ambas.

Las tres categorías

No todo consejo es igual, y decirlo es parte del método

Un ejemplo real de cada categoría, tomado de las fuentes ya procesadas.

MEDIBLE

"Dos líneas en blanco entre funciones"

PEP 8, la guía de estilo de Python. Una regla exacta: se puede contar y comprobar en cualquier archivo.

CRITERIO

"Elegí nombres que revelen la intención"

Código Limpio, de Robert C. Martin. Es un consejo real y valioso, pero no hay un umbral que separe un buen nombre de uno malo.

CONOCIMIENTO

"Namespaces are one honking great idea"

El Zen de Python. Es sabiduría de diseño, no una técnica con una propiedad que comprobar.

En números

El estado actual del proyecto, medido de nuevo cada vez

15 fuentes procesadas
727 técnicas identificadas
151 ejercicios verificables
304 pruebas propias, todas en verde
Dos respuestas honestas

A veces el resultado correcto es "casi nada se puede medir"

Ninguna de las dos fuentes de abajo "falló". Cada una midió lo que realmente había para medir.

PEP 8 — guía de estilo de Python

69% de sus técnicas son medibles

Una guía de estilo pensada para que la revise una herramienta automática. Casi todo lo que dice tiene una regla exacta detrás.

El Zen de Python

0% de sus técnicas son medibles

19 frases de sabiduría de diseño ("lo simple es mejor que lo complejo"). Ninguna tiene un umbral binario — y forzar una sería mentir sobre lo que dice el texto.

Construido por un agente de IA. Verificado por otro, a mano, dos veces.

Varias de las fuentes más recientes las construyó un agente de IA externo, sin supervisión durante el triaje. Cada resultado se volvió a correr desde cero, se le hizo "sabotaje" deliberado a cada regla para confirmar que de verdad detecta el error que dice detectar, y se reconstruyeron a mano los atajos prohibidos para comprobar que el corrector los bloquea. En dos rondas distintas esa verificación encontró errores reales — uno de cobertura incompleta, otro de una prueba que no bloqueaba el atajo que decía bloquear — y ambos se corrigieron antes de aceptar el resultado. Ninguna afirmación se acepta solo porque el agente dice que funcionó.