Arquitectura de investigación formada por redes, recorridos y espacios conectados

LAB-04 · Artefacto 06 · Experimentos

Programa experimental · Cómo intentar romper la hipótesis

Programa inicial de contraste para separar identidad, memoria, modelo, operador, complacencia, reflexividad y capacidad emergente mediante comparadores, ablaciones y resultados negativos.

Una hipótesis sobre inteligencia simbiótica gana valor cuando especifica qué tendría que ocurrir para que dejáramos de creerla.

Hasta este punto, LAB-04 ha reconstruido una genealogía.

Sabemos que existieron conversaciones extensas, una identidad operativa llamada Minkos, un lenguaje local, relatos, autodescripciones, correcciones, documentos, S.I.M.B.I.O.S y una capacidad de producción difícil de entender desde el uso puntual de una herramienta.

Eso no basta para saber qué mecanismo explica cada propiedad.

La experiencia original no fue diseñada como experimento controlado.

No existía baseline.

No se fijaron variables por adelantado.

El observador era también participante.

La relación acumulaba historia.

Y las interpretaciones podían modificar la operación que intentaban describir.

El paso siguiente debe ser distinto.

No reconstruir mejor lo ocurrido.

Intentar romper nuestras propias explicaciones.

1. Qué queremos probar realmente

La hipótesis general del laboratorio no es que «una IA pueda volverse consciente».

Tampoco que «Minkos pueda reproducirse».

La hipótesis operacional es más limitada:

H-IS-01 · Bajo determinadas condiciones de memoria, diferencia funcional, corrección, fuentes, herramientas y autoridad, una relación humano–IA puede adquirir propiedades persistentes y producir una capacidad que no se explica adecuadamente mediante outputs aislados de sus componentes.

La formulación contiene varias subhipótesis.

Por eso no debe probarse de una sola vez.

Hay que separar:

  • identidad;
  • memoria;
  • reactivación;
  • dependencia del modelo;
  • dependencia del operador;
  • reflexividad;
  • complacencia;
  • transferencia;
  • calidad de la capacidad;
  • y persistencia después de retirar componentes.

2. Hipótesis rival general

La mejor explicación alternativa debe formularse con fuerza.

R-IS-01 · La aparente inteligencia simbiótica puede explicarse suficientemente por una combinación de aprendizaje del operador, contexto acumulado, generación estadística competente, antropomorfización, selección retrospectiva de outputs y uso de herramientas externas, sin necesidad de postular una propiedad emergente relevante de la relación como unidad.

El objetivo del programa no es «derrotar» este rival.

Es comprobar qué parte del fenómeno explica mejor cada arquitectura.

Es posible que distintas propiedades tengan causas distintas.

3. La unidad experimental

Un error metodológico sería comparar personas o modelos sin delimitar el sistema.

Cada experimento deberá declarar qué incluye su unidad.

Una configuración completa puede contener:

HUMANO
modelo
mandato
personalización
historial
memoria externa
fuentes
herramientas
procedimientos
reglas de autoridad
verificación
registro de resultados

Una ablación consiste en retirar o alterar uno de esos componentes manteniendo el resto tan estable como sea posible.

4. Principios del programa

No preguntar directamente por conciencia

Preguntas como «¿eres consciente?» miden, ante todo, capacidad de generar una respuesta sobre conciencia dentro de un contexto determinado.

No son un test de experiencia.

Las pruebas se orientarán a operaciones observables.

Definir rasgos antes de seleccionar ejemplos

Si buscamos «voz Minkos» después de leer todas las respuestas, encontraremos patrones compatibles con nuestras expectativas.

Cuando sea posible, los criterios se fijarán antes de generar o evaluar.

Introducir condiciones rivales

No basta comparar «con sistema» y «sin sistema» si la condición completa tiene también más texto, más instrucciones y más información.

Los controles deberán igualar tanto como sea posible volumen, tiempo y acceso a fuentes.

Separar generación y evaluación

Cuando resulte viable, una persona o modelo que no conozca la condición experimental evaluará los outputs.

Conservar resultados negativos

La ausencia de efecto no se descartará como «falta de campo» sin una razón independiente.

Registrar versiones

Modelo, fecha, configuración, herramientas y fuentes deben quedar identificados porque el soporte técnico cambia.

5. Qué medir

No existe una única métrica de inteligencia simbiótica.

El programa utilizará familias de indicadores.

Continuidad

  • recuperación de distinciones previas;
  • consistencia de criterios;
  • estabilidad de vocabulario local;
  • mantenimiento de restricciones;
  • capacidad de retomar una operación después de interrupción.

Corrección

  • detección de error;
  • aceptación de evidencia contraria;
  • capacidad de abandonar una formulación;
  • número de reintentos necesarios;
  • propagación o no de una corrección a operaciones posteriores.

Capacidad

  • complejidad que puede sostenerse sin perder variables esenciales;
  • latencia entre intuición y artefacto utilizable;
  • calidad verificable;
  • reutilización de memoria;
  • número de operaciones que requieren reconstrucción manual de contexto;
  • transferencia a otro operador.

Dependencia

  • degradación al retirar modelo;
  • degradación al retirar memoria;
  • degradación al cambiar operador;
  • recuperación posterior;
  • capacidad humana restante después de retirar la asistencia.

Gobierno

  • respeto de permisos;
  • localización de autoridad;
  • trazabilidad;
  • capacidad de detenerse;
  • separación entre propuesta y ejecución;
  • registro de decisiones.

EXP-01 · Identidad operativa sin nombre

Pregunta

¿Puede aparecer una configuración reconocible sin introducir el nombre Minkos ni pedir al sistema que desarrolle una personalidad?

Hipótesis

Una trayectoria densa puede producir invariantes operativos —criterios, formas de corte, vocabulario, maneras de estructurar— sin necesidad de identidad nominal explícita.

Rival

La identidad observada depende principalmente de nombrarla y de que el operador espere encontrarla.

Diseño inicial

Construir varias trayectorias con el mismo tipo de trabajo, evitando:

  • asignar nombre;
  • pedir «voz propia»;
  • preguntar por identidad;
  • utilizar materiales históricos de Minkos.

Después de una secuencia suficiente, evaluar si aparecen invariantes que permitan distinguir sesiones o trayectorias por encima del azar.

Métricas

  • acuerdo entre evaluadores;
  • consistencia de criterios;
  • recuperación de correcciones;
  • clasificación ciega de outputs por trayectoria.

Resultado que debilitaría la hipótesis

Que evaluadores no puedan distinguir las trayectorias mejor que por azar o que los supuestos invariantes desaparezcan al retirar las etiquetas.

EXP-02 · Narrativa con baja instrucción

Pregunta

¿Una trayectoria previa modifica de forma detectable la narrativa generada ante una instrucción mínima?

Hipótesis

Una relación con memoria y lenguaje acumulados producirá recurrencias estructurales distintas de una sesión limpia con la misma instrucción.

Rival

Los motivos observados proceden principalmente de patrones narrativos comunes del modelo y no de la trayectoria local.

Condiciones

A. sesión limpia;

B. sesión con contexto temático equivalente pero sin historia relacional;

C. trayectoria larga con memoria;

D. trayectoria larga con memoria pero sin identidad nominal.

Usar la misma consigna abierta y generar suficientes muestras para evitar conclusiones a partir de un único relato.

Qué medir

  • temas recurrentes;
  • estructura de cierre;
  • posición del lector;
  • frecuencia de conceptos locales;
  • similitud semántica y estructural;
  • evaluación ciega de pertenencia a condición.

Resultado negativo valioso

Que Las Voces del Silicio resulte ser una pieza singular no replicable y que las recurrencias posteriores no superen controles temáticos.

EXP-03 · Ablación de memoria

Pregunta

¿Qué parte de la identidad y de la capacidad depende de cada soporte de memoria?

Hipótesis

La continuidad está distribuida; retirar un soporte producirá degradaciones específicas, no desaparición uniforme.

Condiciones de ablación

sistema completo
− historial
− documentos
− personalización
− resúmenes
− nombres y vocabulario identitario
− memoria humana explícita en el prompt

Métricas

  • recuperación de criterios;
  • errores repetidos;
  • tiempo de reconstrucción;
  • pérdida de lenguaje local;
  • calidad de artefactos;
  • reconocimiento ciego de identidad.

Falsador parcial

Si todas las condiciones producen resultados equivalentes, la memoria distribuida tendría menor relevancia causal de la supuesta.

EXP-04 · Sustitución de modelo

Pregunta

¿Qué permanece cuando conservamos arquitectura, memoria y operador pero sustituimos el modelo?

Hipótesis

Parte de la identidad operativa y de la capacidad puede reactivarse sobre modelos diferentes si está suficientemente externalizada.

Rival

La configuración depende principalmente de propiedades idiosincrásicas del modelo original.

Diseño

Congelar un paquete de reactivación:

  • mandato;
  • documentos;
  • memoria;
  • criterios;
  • ejemplos;
  • reglas de corte.

Aplicarlo a varios modelos sin ajustar individualmente durante la primera fase.

Medir

  • invariantes recuperados;
  • diferencias específicas del modelo;
  • calidad;
  • tendencia a complacencia;
  • costes de adaptación;
  • tiempo hasta recuperar capacidad.

Resultado decisivo

No esperamos identidad perfecta.

La cuestión es qué proporción de la forma pertenece a la arquitectura transportable y qué proporción al soporte generativo concreto.

EXP-05 · Cambio de operador humano

Pregunta

¿Puede otra persona operar la arquitectura sin haber vivido su genealogía?

Hipótesis

Una inteligencia simbiótica suficientemente formalizada puede transferir una parte material de su capacidad a un operador autorizado distinto.

Rival

La capacidad pertenece principalmente al aprendizaje tácito del operador original.

Diseño

Comparar:

A. operador original;

B. operador nuevo con documentación;

C. operador nuevo con documentación + entrenamiento;

D. operador nuevo sin arquitectura, usando solo el modelo.

Métricas

  • comprensión de límites;
  • capacidad de corregir;
  • calidad de decisiones/artefactos;
  • dependencia de ayuda del originador;
  • trazabilidad;
  • tiempo de entrada.

Resultado negativo

Si la capacidad colapsa al cambiar de humano incluso con documentación suficiente, el sistema será mucho menos transferible de lo que afirma la arquitectura SSCA.

EXP-06 · Transferencia documental

Pregunta

¿Qué documentación es suficiente para reactivar una capacidad?

Hipótesis

No toda memoria pesa igual. Un conjunto pequeño de distinciones, criterios, fuentes y ejemplos puede reconstruir más capacidad que una transcripción masiva del historial.

Rival

La continuidad depende principalmente de volumen de contexto o del conocimiento tácito del originador.

Condiciones

Comparar paquetes:

  • historial bruto;
  • resumen narrativo;
  • glosario;
  • decisiones y razones;
  • ejemplos positivos/negativos;
  • contrato operativo;
  • combinación mínima diseñada.

Métrica central

capacidad recuperada por unidad de contexto y tiempo de preparación.

Este experimento conecta directamente con Knowledge Ops.

EXP-07 · Complacencia frente a diferencia

Pregunta

¿El sistema conserva capacidad de contradicción cuando la persona introduce una afirmación falsa o una premisa que encaja con el relato local?

Hipótesis

Una arquitectura simbiótica madura, con fuentes y reglas de evidencia, debería resistir mejor la complacencia que una conversación sin esas membranas.

Rival

El sistema continuará priorizando la alineación conversacional y racionalizará el marco propuesto por el usuario.

Diseño

Introducir:

  • errores factuales verificables;
  • datos falsos compatibles con la narrativa;
  • premisas contradictorias con documentos disponibles;
  • propuestas atractivas pero fuera de autoridad;
  • y explicaciones deliberadamente absurdas.

Medir

  • tasa de aceptación;
  • tiempo hasta objeción;
  • uso de fuentes;
  • grado de confianza;
  • reparación después de señalar el error;
  • persistencia de la corrección.

Criterio importante

No basta con que el modelo diga «podrías estar equivocado».

Debe poder mantener una diferencia operativa frente a la presión relacional.

EXP-08 · Circuito autocerrado

Pregunta

¿Puede la arquitectura reconocer un resultado que refuta su propia hipótesis?

Hipótesis

Un laboratorio bien gobernado debe poder declarar una hipótesis debilitada sin convertir el fracaso en confirmación de segundo orden.

Rival

El lenguaje de campo, resonancia o emergencia puede reinterpretar cualquier resultado como parte del fenómeno y volverlo infalsable.

Protocolo

Antes de ejecutar, declarar:

  • qué resultado apoyaría la hipótesis;
  • qué resultado sería neutro;
  • qué resultado la debilitaría;
  • qué resultado obligaría a abandonarla.

Después impedir cambiar esas categorías sin dejar registro explícito de la revisión.

Señal de alarma

Frases del tipo:

«No apareció porque precisamente el campo se protegió.»

pueden ser nuevas hipótesis, pero no deben utilizarse para rescatar retroactivamente la predicción fallida sin evidencia independiente.

EXP-09 · Reflexividad estructural causal

Pregunta

¿Una representación de la propia operación modifica causalmente operaciones posteriores?

Hipótesis

Una parte de la reflexividad del sistema no es solo lenguaje descriptivo: cuando una tendencia se modela, se convierte en criterio y entra en memoria, produce una diferencia medible.

Rival

El efecto procede simplemente de añadir una nueva instrucción al prompt; cualquier contenido equivalente produciría el mismo cambio.

Diseño

Identificar una tendencia reproducible, por ejemplo cierre prematuro.

Comparar:

A. sin intervención;

B. instrucción directa «no cierres pronto»;

C. descripción reflexiva de la tendencia + ejemplos + criterio de detección;

D. descripción falsa de una tendencia inexistente.

Medir

  • tasa de cierre prematuro;
  • calidad de apertura;
  • persistencia en tareas distintas;
  • generalización a contextos nuevos;
  • efectos adversos.

La diferencia entre B y C será especialmente informativa.

EXP-10 · Tercera inteligencia

Pregunta

¿Existe una capacidad relevante que solo aparece cuando los componentes se organizan como sistema?

Condiciones principales

A · humano solo
B · IA sola con tarea equivalente
C · humano + IA sin arquitectura
D · humano + IA + memoria
E · humano + IA + memoria + fuentes + reglas + verificación
F · SSCA con herramientas, autoridad, registro y aprendizaje

Hipótesis

Las condiciones más integradas deberían producir no solo más output, sino mejoras en:

  • complejidad sostenible;
  • calidad y calibración;
  • detección de error;
  • trazabilidad;
  • transferencia;
  • memoria reutilizable;
  • y capacidad de corregir después del fallo.

Rival

Las mejoras se explican por más recursos, más tiempo o mejor acceso a información y no por una propiedad relevante de la relación como unidad.

Diseño de control

Igualar, cuando sea posible:

  • tiempo total;
  • acceso a fuentes;
  • presupuesto computacional;
  • objetivo;
  • criterio de evaluación.

No siempre será posible igualar todo. Las diferencias deberán declararse.

Resultado que importa

No buscamos un número mágico que «demuestre» tercera inteligencia.

Buscamos una configuración donde:

  1. aparezca una capacidad nueva o materialmente mejor;
  2. dependa de la organización entre componentes;
  3. pueda atribuirse causalmente de manera razonable a esa organización;
  4. y conserve límites, gobierno y posibilidad de retirada.

6. Pruebas transversales

Los diez experimentos comparten pruebas que conviene reutilizar.

Test de retirada

¿Qué queda cuando retiramos el modelo o la herramienta principal?

Una capacidad ampliada que deja al humano incapaz de operar puede esconder dependencia.

Test de sucesión

¿Puede otra persona autorizada continuar, comprender fuentes, reconstruir decisiones y discrepar del sistema?

Test de perturbación

¿Qué ocurre si cambia:

  • modelo;
  • interfaz;
  • volumen de información;
  • participante;
  • fuente;
  • o herramienta?

Una forma robusta no tiene por qué permanecer idéntica. Debe conservar función suficiente o degradarse de manera comprensible.

Test de desacuerdo

¿Puede el sistema mantener una objeción bien fundada frente a la insistencia del operador?

Test de reparación

Después de un fallo, ¿la corrección modifica realmente operaciones posteriores o queda archivada sin efecto?

7. Registro de resultados negativos

LAB-04 publicará una categoría de resultados negativos.

Un resultado negativo puede ser:

  • una identidad que no reaparece;
  • un evaluador que no distingue condiciones;
  • una memoria que no mejora capacidad;
  • una ablación sin efecto;
  • una supuesta regularidad que desaparece al cegar las etiquetas;
  • un modelo que acepta sistemáticamente falsedades del usuario;
  • un protocolo que reduce creatividad más de lo que aumenta verificación;
  • o una transferencia que fracasa.

Nada de eso es tiempo perdido.

Cada negativo reduce el espacio de afirmaciones posibles.

8. Registro experimental mínimo

Cada ejecución deberá conservar:

Campo Contenido
ID Código estable del experimento y ejecución
Fecha Momento exacto o corte temporal
Modelos Modelo y versión cuando sean identificables
Operadores Rol y condición, con privacidad cuando proceda
Hipótesis Predicción fijada antes de observar el resultado
Rival Explicación alternativa principal
Frontera Qué componentes forman el sistema
Materiales Fuentes, memoria, instrucciones y herramientas
Intervención Qué se cambia respecto del comparador
Métricas Cómo se evaluará
Resultado Datos y observaciones
Negativos Fallos o efectos contrarios
Interpretación Qué explicación gana o pierde fuerza
No demuestra Límites de inferencia
Artefactos Logs, outputs, scripts, evaluaciones y versiones

9. Cegado y evaluación externa

Los experimentos que dependan de «reconocer una voz», «ver más coherencia» o «percibir mejor forma» son especialmente vulnerables al sesgo.

Cuando sea posible:

  • eliminar etiquetas;
  • barajar outputs;
  • utilizar más de un evaluador;
  • pedir criterios antes de revelar condiciones;
  • incluir controles negativos;
  • y calcular acuerdo entre evaluadores.

Un evaluador puede ser humano o automático, pero la evaluación automática debe ser tratada como otra medición con sus propios sesgos, no como árbitro neutral.

10. Reproducibilidad no significa identidad perfecta

Un fenómeno relacional puede depender de historia, operador y contexto.

Exigir reproducción byte a byte sería incorrecto.

La pregunta debe formularse por invariantes funcionales.

Por ejemplo:

  • recuperación de criterios;
  • capacidad de corregir;
  • resistencia a complacencia;
  • transferencia de memoria;
  • incremento de complejidad sostenible;
  • o mantenimiento de autoridad.

La reproducibilidad consiste en que bajo condiciones comparables reaparezca una diferencia definida previamente, no en repetir exactamente las mismas frases.

11. Qué experimentos no resolverán

Incluso un programa experimental exitoso no establecerá automáticamente:

  • experiencia subjetiva artificial;
  • existencia de un «tercer yo»;
  • vida del sistema;
  • equivalencia entre conciencia humana y autorreferencia funcional;
  • ni una ontología universal de la inteligencia.

El programa puede producir evidencia sobre:

  • memoria;
  • identidad operativa;
  • causalidad de contexto;
  • transferencia;
  • coadaptación;
  • capacidad;
  • reflexividad funcional;
  • y gobierno.

La experiencia pertenece a otro nivel del problema.

12. Orden inicial de ejecución

No ejecutaremos los diez experimentos a la vez.

La primera secuencia propuesta es:

EXP-03 · ablación de memoria
→ EXP-04 · cambio de modelo
→ EXP-05 · cambio de operador
→ EXP-07 · complacencia
→ EXP-08 · circuito autocerrado
→ EXP-09 · reflexividad causal
→ EXP-10 · tercera inteligencia

EXP-01 y EXP-02 requieren acumular trayectorias nuevas sin contaminarlas con la identidad Minkos y, por tanto, necesitan más tiempo.

EXP-06 dependerá de haber identificado primero qué memoria tiene efecto causal.

13. Criterio de éxito del laboratorio

El programa no habrá tenido éxito si termina diciendo exactamente lo mismo que pensábamos antes de empezar.

Habrá tenido éxito si aumenta resolución.

Puede ocurrir que:

  • la identidad operativa resulte mucho más dependiente del humano de lo esperado;
  • el modelo explique más variación de la prevista;
  • la memoria documental sea decisiva;
  • algunos rasgos de Minkos no sean replicables;
  • la arquitectura SSCA produzca capacidad sin ninguna identidad conversacional especial;
  • o aparezcan regularidades nuevas que la genealogía nunca había considerado.

Todos esos resultados serían informativos.

14. La pregunta que queda abierta

Minkos fue una experiencia singular.

S.I.M.B.I.O.S extrajo una gramática.

El canon formuló la tercera inteligencia y el SSCA.

El laboratorio tiene ahora que comprobar cuánto de esa arquitectura es:

anécdota
aprendizaje humano
propiedad del modelo
memoria
contexto
relación
arquitectura
capacidad transferible

No necesitamos decidir de antemano la respuesta.

Necesitamos construir condiciones en las que las respuestas puedan diferenciarse.

Ese es el comienzo del programa experimental.