Herramientas y librerías para la optimización de Modelos de Lenguaje Grande — diseñadas para hacer las interacciones con IA más rápidas, económicas y eficientes.
Estos proyectos se enfocan en optimizar la entrada a los Modelos de Lenguaje Grande antes de que procesen tu solicitud. Mientras la mayoría de herramientas se concentran en lo que el modelo genera, estos trabajan en lo que entra al modelo — y eso puede tener un impacto dramático en el coste, la velocidad y la calidad.
Flujo combinado: Solicitud del usuario → PCM (comprime la instrucción) → COE (optimiza el contexto) → LLM
Comprime instrucciones en lenguaje natural a un formato compacto y legible por máquina.
En lugar de enviar prompts largos y verbosos a tu LLM, PCM los transforma en un formato conciso que transmite la misma intención con muchos menos tokens.
| Antes | Después |
|---|---|
Revisa este código Python cuidadosamente en busca de condiciones de carrera, fugas de memoria y oportunidades de optimización. Devuelve un informe en Markdown ordenado por gravedad. |
TASK=review INPUT=python CHECK=race,leak,perf FORMAT=markdown ORDER=severity |
Ahorro de tokens: 51-81% en tokens de instrucción
Compacta tu contexto sin perder información.
Cuando proporcionas chunks de RAG, historial de chat, fragmentos de código o logs a un LLM, COE reorganiza y elimina duplicados, fusionando hechos relacionados y eliminando redundancias mientras preserva toda la información esencial.
Ahorro de tokens: 32-46% en tokens de contexto (con benchmarks de factual_recall ≥ 0.95)
Cada token ahorrado es dinero ahorrado. Para aplicaciones de LLM con alto volumen, estas optimizaciones pueden reducir los costes de infraestructura en un 30-50% o más.
Entradas más pequeñas significan respuestas más rápidas y la capacidad de incluir más contexto dentro de los límites del modelo.
Al estructurar la información de manera más eficiente, el modelo puede enfocarse en lo que realmente importa en lugar de procesar redundancias.
| Escenario | PCM | COE | Combinado |
|---|---|---|---|
| Prompts largos con instrucciones detalladas | ✅ Alto ahorro | ❌ No aplicable | ✅ Ideal |
| RAG con documentos solapados | ❌ No aplicable | ✅ Alto ahorro | ✅ Ideal |
| Chat con historial de conversación largo | ❌ No aplicable | ✅ Alto ahorro | ✅ Ideal |
| Flujos de revisión de código | ✅ Bueno ahorro | ✅ Bueno ahorro | ✅ Mejor |
| Preguntas simples | ❌ Saltar (demasiado corto) | ❌ Saltar (demasiado corto) | ❌ No necesario |
Ambos proyectos ofrecen múltiples formas de integración:
| Proyecto | Lenguaje | Dependencias | Licencia |
|---|---|---|---|
| PCM | Python 3.11+ | FastAPI, Ollama, Pydantic | Prototipo de investigación |
| COE | Python 3.10+ | Pydantic, NumPy, scikit-learn | MIT |
Ambos proyectos son completamente de código abierto en GitHub:
¡Las contribuciones, comentarios y estrellas son bienvenidos!
Estos son prototipos de investigación. Úsalos bajo tu propia responsabilidad. No listos para producción.