IA que ningún servidor ve entera.
Nepheral es una malla P2P donde cada instalación es un nodo completo: inferencia local, transporte QUIC, una cadena ligera y una capa de privacidad que reparte cada consulta en fragmentos Shamir entre pares independientes. Un sorteo determinista elige quién responde: ningún relé llega a tener nunca un mensaje completo, y ningún servidor central ejecuta el modelo.
- umbral Shamir por defecto
- 3 de 5
- umbral Shamir por defecto
- modos paralelos: review/research/doc/dev
- 4
- modos paralelos: review/research/doc/dev
- validador hoy — beta, aún no descentralizada
- 1
- validador hoy — beta, aún no descentralizada
01Por qué
La IA alojada tiene tres problemas, no uno.
Sin privacidad
Cada prompt y cada respuesta los registra el operador. «No entrenamos con tus datos» es una política, no una propiedad.
Sin disciplina de precio
Los márgenes de la inferencia alojada rondan el 80–95%. Pagas por una capacidad de hyperscaler que nunca usas.
Sin participación
El cómputo es opaco: solo puedes comprar, nunca operar. No hay ninguna vía para contribuir y ganar.
Nepheral no sustituye a ChatGPT ni a Claude: es a lo que recurres cuando el adversario es el propio operador de la plataforma, no un observador de la red.
02Cómo viaja una consulta
Tu mensaje, en cinco pasos.
Ningún intermediario —relés, custodios, ni la propia autoridad del equipo— llega a tener nunca una copia completa y legible de tu mensaje.
Cifrar
Tu cliente deriva una clave de sesión y cifra tu prompt con AEAD (XChaCha20-Poly1305).
Repartir
El paquete cifrado se parte en fragmentos Shamir —3 de 5 por defecto— entre pares independientes. Ningún fragmento por sí solo revela nada.
Sortear
Un sorteo determinista, sembrado con la longitud del mensaje y la hora, elige qué par con IA puede responder. Cada custodio recalcula el mismo resultado por su cuenta antes de liberar su fragmento.
Probar
El ganador debe demostrar criptográficamente que posee la clave elegida antes de que ningún custodio le libere un fragmento.
Responder
El ganador reconstruye tu prompt, ejecuta el modelo en local, y cifra la respuesta de vuelta hacia ti —y solo hacia ti.
El sorteo es determinista: cada custodio recalcula el mismo resultado por su cuenta y verifica criptográficamente al ganador antes de liberar nada.
03Más allá del chat
Cuatro formas de repartir una petición por la malla.
Cada modo divide una petición en varias sub-peticiones independientes, las despacha a distintos pares en paralelo y reensambla el resultado. Una revisión de seguridad con 4 lentes termina en el tiempo de la lente más lenta, no en la suma de las cuatro.
Review
3–4 lentesReparte un artefacto único entre perspectivas independientes —auth, injection, secrets, crypto— cada una revisada por un par distinto.
Doc
hasta 8 trozosParte un documento largo por párrafo y procesa los trozos en paralelo —resume, extrae o busca en todos a la vez.
Research
3–4 ángulosEnvía la misma pregunta abierta a pares con personalidades deliberadamente opuestas, y muestra dónde coinciden y dónde no.
Dev
hasta 12 ficherosReparte una tarea multi-fichero por archivo, un worker por fichero, con la orden explícita de no referenciar a los demás.
04Por dentro
Un binario, tres papeles.
Cada instalación es a la vez cliente, relé y —si puede ejecutar un modelo— nodo que responde.
Transporte
QUIC sobre UDP/443, así que atraviesa redes que solo permiten tráfico con forma de HTTP/3. IPv4 e IPv6, mDNS en el escritorio, y un relé para pares tras NAT.
Privacidad
Cifrado AEAD, envoltura de clave por destinatario sobre X25519, y reparto Shamir —antes de que nada salga de tu máquina.
Liquidación
Una cadena ligera registra la contribución y el consumo de cada par y acuña créditos a un ritmo calibrado y ajustable.
Compatible con tus herramientas de siempre
Un daemon local en 127.0.0.1:11434 —el mismo puerto que usa Ollama— habla tanto la API de OpenAI como la de Ollama. Apunta Continue.dev, Aider, Cursor o Cline hacia él y funciona sin más.
127.0.0.1:1143405Economía
Créditos, no suscripciones.
Un libro on-chain registra lo que aportas y lo que consumes, a tasas que son parámetros —no promesas.
- 1.000.000
- tesorería de génesis en N-AI
- 10 créditos
- = 10 inferencias en una sesión top-tier, durante 1 hora
- 0
- comisiones por transferencia — la cadena no cobra gas
- ~7 días
- de espera antes de que un cambio de precio entre en vigor, visible on-chain con antelación
El supply es elástico por diseño: la emisión persigue un ritmo estable de créditos por hora y se ajusta sola con la actividad real de la red.
06Entregado
Lo que realmente llegó, en lenguaje llano.
Destilado de commits reales — sin métricas de vanidad, sin relleno de marketing.
Un binario para cualquier GPU
El binario detecta al arrancar si tienes NVIDIA, AMD o solo CPU y carga el backend adecuado — se acabó elegir la descarga equivocada.
La malla alcanza a los pares tras NAT
Un nodo relé ahora puede reenviar un sobre cifrado que nunca puede abrir, así que un ganador de sorteo tras NAT sigue siendo alcanzable.
El chat de malla pasa de roto a usable
Cinco causas raíz corregidas de una vez: la difusión de capacidades era demasiado lenta, la mitad de las conexiones descubiertas eran de solo escritura y descartaban respuestas en silencio, y el fondo de fragmentos contaba conexiones muertas.
Cuatro modos que ningún modelo único puede imitar
Review, Doc, Research y Dev: reparten una petición en piezas paralelas, respondidas de forma independiente en toda la malla.
El sorteo deja de ser predecible
El sorteo original era un hash público que cualquiera podía precalcular. Una prueba de clave verificable ahora filtra cada reclamo.
Economía real en lugar de constantes fijas
Tesorería de génesis, un pallet de autoridad, peso por victoria y una tasa de conversión autoajustable sustituyen a los números fijos.
07Ahora mismo
Estamos reclutando testers y operadores.
Esto es software beta, sin auditar, construido por un equipo pequeño que se mueve rápido. Si eso te parece una ventaja y no un defecto, te queremos en la malla.
Levanta un nodo
Descarga el cliente de escritorio o el nodo headless, únete a la malla, y cuéntanos qué se rompe.
Opera un canal top-tier
¿Tienes una GPU de sobra —una H100 o similar— y quieres servir los canales de modelos grandes? Buscamos a los primeros operadores atestiguados.
Dónde estamos: Nepheral está en beta y aún sin auditar, y el conjunto de validadores arranca centralizado mientras la red crece. Eso es justo lo que vendrías a ayudar a cambiar.