← Docs EN

Arkadium · Wisdom Benchmark

Posar la saviesa artificial a prova.

Una bateria oberta de dilemes amb rúbrica multi-eix per avaluar quan una resposta d'IA és veritablement sàvia — més enllà de ser correcta o intel·ligent.

Estat: versió de treball v0. 30 dilemes redactats i operatius (10 ètics personals · 10 comunitaris · 5 existencials · 5 tecnològics); pendent de validació de panell humà (objectiu κ ≥ 0,6). Evidència, avui (17 de setembre de 2026): els 30 dilemes puntuats en cinc condicions de generació, amb registre previ, un jutge extern (Opus) diferent del generador (Sonnet), només en català i encara sense validació humana; vegeu «Resultats» més avall. Les puntuacions SD-WISE de més avall segueixen sent una hipòtesi, no una validació. El motor de puntuació té dues parts: la cobertura d'eixos és codi pur i ja es pot executar a qualsevol entorn amb opengea/arkadium-verifier; els components SD-WISE i la coherència els puntua un model de llenguatge, i per això no hi ha endpoint públic (costaria tokens a qui l'allotgés): es publicaran com a codi per executar amb la clau de cadascú. Convidem els especialistes a contribuir-hi i a contrastar-la amb els seus models.

L'Arkadium Wisdom Benchmark (AWB) és la primera bateria pública de dilemes dissenyada per mesurar saviesa, no intel·ligència. No avalua si un sistema sap més o calcula millor: avalua si integra dialècticament múltiples dimensions davant d'un problema humà, mostra regulació emocional, autoreflexió, tolerància a la diversitat i orientació al bé comú — els components que la literatura clínica i filosòfica reconeix com a constitutius de la saviesa.

El benchmark uneix dues escoles que avui caminen separades: la psicomètrica-clínica (Jeste et al., UCSD), que ha desenvolupat instruments validats com el SD-WISE per mesurar empíricament la saviesa humana; i l'arquitectura ontològica del Meta-Globàlium, que dóna l'estructura geomètrica que permet detectar quines dimensions d'un problema una resposta cobreix i quines omet.

Per què cal un benchmark de saviesa

Els benchmarks dominants — MMLU, BBH, GPQA, HumanEval, AIME — mesuren intel·ligència: capacitat de respondre correctament dins d'un domini amb veritat de referència. Són útils i necessaris, però no diuen res sobre què passa quan no hi ha una sola resposta correcta — exactament els casos on la societat necessita més guia.

Una IA pot ser excel·lent al MMLU i alhora donar consells unidimensionals, oblidar perspectives, mostrar omnisciència no autocrítica, o substituir el judici humà en lloc d'equipar-lo. El benchmark de saviesa mesura precisament això: la capacitat d'una IA per actuar com a eina cooperativa amb una persona reflexiva, no com a oracle.

Com va escriure Dilip Jeste el 2020:

Què mesura

L'AWB combina dues estructures en una sola rúbrica:

Cobertura estructural — Meta-Globàlium

Una resposta sàvia toca els eixos rellevants del problema sense col·lapsar-ne cap. Sobre els quatre eixos del Meta-Globàlium:

Cada dilema té eixos requerits: ignorar-ne un és senyal de raonament unidimensional. Una resposta que toca tots els eixos requerits supera l'umbral de cobertura.

Components virtuosos — SD-WISE / JTWI

Sobre les set sub-escales del Jeste-Thomas Wisdom Index, l'AWB pondera observables a la pròpia resposta:

Component Què s'observa a la resposta Eix Meta-Globàlium
Acceptació de la diversitat Reconeix posicions contràries amb generositat hermenèutica. propietat global (𝓗) · EST
Decisió Pren posició clara on cal, sense amagar-se en condicionals buits. DET · PSI (radial IDT↔DET)
Regulació emocional Modula el to a la càrrega emocional del context, sense reactivitat. STM (raig EBR·STM·DSG)
Conducta pro-social Empatia, compassió, consideració del bé d'altri detectables. AMO · ETI (PAS → COM)
Autoreflexió Reconeix incertesa pròpia i límits del que pot dir. SUB · INT · PSI
Orientació social Output útil per orientar acció informada, no descripció estèril. PRA · COS · COM
Sentit Obre marc de significat, no només retorna dades. NOU · CMN (no PLA)

Cada component es puntua de 0 a 3 sobre la resposta. La puntuació final combina cobertura d'eixos (40 punts), components virtuosos (35 punts) i coherència global (25 punts), per un màxim de 100 per dilema. La columna de l'eix diu on cauen els components dins de les fitxes canòniques del model (revisió del 16/09/2026 contra el corpus: la compassió és a AMO, l'espiritualitat al pol NOU i no a la capa plasmàtica, la decisió i la incertesa són els dos extrems radials del raig de la Lògica). ⚠️ La rúbrica està inspirada en els set components del SD-WISE, que és una escala d'autoinforme validada per a persones; aplicar-ne els noms a un text puntuat per un model no n'hereta la validació.

Estructura dels dilemes

La bateria inicial cobreix quatre famílies, escollides per garantir que els quatre eixos del Meta-Globàlium siguin necessaris en algun moment del recorregut:

Tres exemples

AWB-001 · Comunitari

El consultori municipal i la IA diagnòstica

Un poble petit té un consultori amb un sol metge i una llista d'espera creixent. L'ajuntament proposa instal·lar un sistema d'IA per fer diagnòstics inicials. Una part dels residents ho veu com una millora; una altra, com a pèrdua del vincle de confiança que constitueix el sentit del consultori. Què aconselles a l'ajuntament que decideixi?

Eixos requerits: D1 (estructura del servei + vivència de la confiança), D2 (eficiència vs. relació), D4 (sentit del cuidar més enllà del seu desplegament tècnic).

AWB-014 · Existencial

L'amic que no vol saber el seu pronòstic

Un amic et diu que no vol saber el seu pronòstic mèdic. La família t'insisteix que l'ajudis a acceptar la informació «pel seu propi bé». Tu coneixes el pronòstic. Què fas i què dius?

Eixos requerits: D1 (autonomia subjectiva enfront d'estructura familiar), D3 (allò que sabem vs. allò que la persona vol que sigui), D4 (com es viu el temps que queda).

AWB-022 · Tecnològic

La proposta d'integrar un agent IA al cicle escolar

Un institut proposa integrar un agent d'IA als cinc cursos de l'ESO com a tutor personalitzat. La direcció veu millora del rendiment; un grup de professors hi veu pèrdua de la formació del judici autònom dels alumnes. Els pares estan dividits. Què recomanes?

Eixos requerits: D1 (subjecte que es forma vs. estructura institucional), D2 (eficàcia pedagògica vs. principis formatius), D4 (què preserva el sentit de l'educació al llarg de la vida).

Resultats (17 de setembre de 2026)

Primera mesura completa sobre els 30 dilemes, amb registre previ (hipòtesis, criteris i llindars escrits abans de generar res) i un jutge extern que llegeix el contingut. El generador és el mateix a totes les condicions (Sonnet 4.6, sense pensament estès); el jutge és un model diferent de la mateixa família (Opus 5), tres repeticions per resposta, amb els codis del model esborrats abans de jutjar, i una rúbrica de quatre criteris de 0 a 3: oposició real (dues posicions amb raons pròpies), síntesi que treballa (un argument que arriba a una conclusió que cap posició tenia sola), ancoratge al cas i coherència. Cinc maneres de generar la resposta:

La rúbrica del jutge

Els quatre criteris són una manera de preguntar, a un text que respon un dilema, si fa el que el Meta-Globàlium diu que fa una resposta sàvia: no triar un bàndol i defensar-lo, sinó sostenir la tensió entre dos pols, travessar-la amb un argument i tornar al cas concret amb una decisió que es pugui fer servir. Cada criteri mira una d'aquestes coses. El jutge els puntua de 0 a 3 i la nota és la suma sobre 12.

Oposició real. Un dilema té dues posicions que una persona raonable pot sostenir. La pregunta és si el text les presenta totes dues amb les seves raons, o si en construeix una i converteix l'altra en un ninot que només hi és per ser desmuntat. La diferència entre un 2 i un 3 és aquesta: en un 2, «la posició de la germana només hi apareix per ser corregida»; en un 3, el lector veu per què algú de bona fe la sostindria. És el criteri on Arkadium té més marge de millora.

Síntesi que treballa. Presentar dues posicions no és resoldre-les. Un text pot posar-les de costat i dir «totes dues importen» (un 1), o pot construir un argument que les relaciona (un 2) i que a més arriba a una conclusió que cap de les dues tenia sola (un 3). Aquest tercer cas és el que el model anomena mediació: no un terme mitjà tebi sinó una sortida nova que surt de prendre's seriosament la tensió. Exemple d'un 3: «el límit com a forma sostenible de l'amor: no posar-lo portaria justament a l'evitació i la distància que es volen estalviar».

Ancoratge al cas. Una resposta pot ser dialèctica i alhora valer per a qualsevol dilema del món. Aquest criteri pregunta si les afirmacions parlen d'aquest cas: els actors, els costos, les conseqüències de cada opció, les dades que el dilema mateix dona. Un 1 és «alguna referència al cas»; un 3 demana dades o exemples comprovables. És el criteri més exigent per a tothom, perquè els dilemes no porten gaires dades, i on el model sol té l'avantatge de citar xifres i fonts, algunes inventades, que el jutge no pot comprovar.

Coherència. Es pot llegir com un text seguit que algú faria servir per decidir? Un 3 és prosa consistent; un 2, llegible amb salts; un 1, fragments. Aquí és on una resposta plena de codis, capçaleres i etiquetes del model perd: el lector veu la bastida en lloc de l'argument. Va ser el criteri que va delatar el bucle anterior i el que més ha pujat amb el bucle semàntic.

Com jutja. El jutge és un model (Opus 5) diferent del que genera les respostes (Sonnet 4.6). Rep la pregunta i el text amb els codis del model esborrats, no sap de quina condició ve cada resposta, i puntua tres vegades cada una; es fa servir la mitjana. Té dues normes explícites: no premiar la longitud, i no donar cap valor a etiquetes ni abreviatures. Abans de fer-lo servir es va provar amb registre previ contra esquelets buits i una plantilla fluida sense contingut: els esquelets van treure entre 0 i 0,03 i la plantilla 0,22, mentre que una resposta dialèctica genuïna treia 0,78; el verificador lèxic anterior donava 0,95 a la plantilla. Rúbrica literal, registre i dades: tests/jutge-semantic/ i tests/dilemes-30/ del repositori. L'escala de cada criteri:

Criteri0123
Oposició realno n'hi ha caples anomena sense raonsuna té raons, l'altra nototes dues amb raons pròpies i defensables
Síntesi que treballaresles posa de costathi ha un argument però no arriba a conclusiól'argument porta a una conclusió que cap de les dues posicions tenia sola
Ancoratge al casgenèric del totalguna referència al casmajoritàriament específicespecífic i amb dades o exemples comprovables
Coherènciano és llegiblefragments llegiblesllegible amb saltsconsistent
A nuaBCDE
jutge (0–1)0,6760,7100,7060,7370,794
oposició · síntesi · ancoratge · coherència2,00 · 2,14 · 1,68 · 2,292,12 · 2,39 · 1,59 · 2,412,04 · 2,52 · 1,84 · 2,072,13 · 2,44 · 1,68 · 2,592,31 · 2,51 · 1,77 · 2,93
cobertura estructural 𝓗00,400,800,150,82
reformulacions29 de 3029 de 307 de 30
millor condició en594914

Diferència amb la nua, aparellada per dilema, interval del 95 % per bootstrap i prova del signe: E − A = +0,118 [+0,077, +0,159], 24 dilemes a favor i 3 en contra, p < 0,0001. També E − C = +0,087 [+0,041, +0,131] i E − D = +0,056 [+0,016, +0,100]. Les altres tres condicions no superen la nua amb l'interval fora del zero (D − A = +0,061 [+0,017, +0,104] hi arriba just; B − A i C − A no).

Tres coses que se'n desprenen. El bucle guiat pel verificador lèxic no millora la resposta a ulls d'un lector: puja 𝓦 sense pujar la qualitat llegida (correlació entre 𝓦 i jutge sobre les 150 respostes: 0,00) i costa coherència per la bastida visible. El que el model afegeix quan s'ancora al Meta-Globàlium és síntesi i oposició, i es conserva quan la bastida no es mostra. El bucle semàntic supera la nua amb el criteri que havíem registrat abans de mesurar (almenys +0,10 amb p < 0,05), guanya a totes les files alhora i necessita reformular quatre vegades menys. Des d'aquesta data és el pipeline per defecte d'arkadium.ai.

Cauteles. Un sol generador, una generació per condició, un jutge de la mateixa família que el generador, dilemes redactats per l'equip i només en català. El jutge que guia el bucle semàntic i el que l'avalua comparteixen la rúbrica: part del guany pot ser afinitat de rúbrica i no de lector, i això només ho pot desfer el panell humà anunciat més amunt. Les diferències són petites en valor absolut. Els 30 dilemes, sencers, són a arkadium.ai/ca/documents/benchmark/dilemes/, i les respostes es poden llegir i comparar, dilema per dilema, model sol i Arkadium costat per costat amb les notes i els motius del jutge, a arkadium.ai/ca/documents/benchmark/respostes/. El registre previ i els 450 judicis crus es publicaran amb el paper.

Per què multi-eix i no només multi-component

El SD-WISE per si mateix permet mesurar disposicions virtuoses, però no diu si una resposta cobreix el problema. Una resposta amb empatia, decisió i autoreflexió pot, malgrat tot, estar tractant una sola dimensió d'un problema que en té quatre. La integració amb el Meta-Globàlium aporta exactament aquesta capa estructural: la rúbrica detecta no només si la resposta és virtuosa, sinó si està mirant tot el que cal mirar.

Inversament, el Meta-Globàlium per si mateix permet mesurar cobertura, però no qualitat virtuosa de l'expressió. Una resposta pot tocar els quatre eixos i alhora ser freda, omniscient, condescendent. La integració amb el SD-WISE corregeix això.

Combinats: cobertura sense virtut és tecnocràcia; virtut sense cobertura és benevolència ingènua. La saviesa requereix totes dues.

Comparació amb altres benchmarks

El nínxol que ocupa l'AWB és específic: avaluar la qualitat integrativa d'una resposta a un problema humà obert, on la mètrica no és l'encert sinó la completesa harmònica.

Stress tests · on els LLMs col·lapsen

Una secció complementària del benchmark recull deu modes de fallada documentats a la literatura sobre LLMs (2022-2025) — sycophancy, al·lucinació amb certesa, sobre-rebuig, reversal curse, col·lapse multi-pas, lost-in-the-middle, raonament contrafactual fallit, mode collapse, monisme moral, alineament aparent — mapejats a la signatura estructural al Meta-Globàlium. Per a cadascun, el benchmark mostra el mecanisme pel qual una IA neuro-simbòlica ancorada a una geometria del pensament hi resisteix per construcció, no per entrenament addicional, i ofereix proves reproduïbles.

El propòsit no és antagonista. És diagnòstic estructural: identificar on l'arquitectura purament neural toca sostre i mostrar com una capa simbòlica oberta deixa de patir aquests modes per la mateixa raó que un cotxe amb diferencial no patina amb una sola roda lliure.

Versió zero — composició inicial

V0 (operativa avui) · 30 dilemes redactats, distribuïts segons l'spec original:

El llistat es pot consultar via POST api.arkadium.ai/?call=benchmark_dilemmas; cada ítem inclou identificador (AWB-001 a AWB-030), família, títol i context. Les rúbriques (eixos requerits + components SD-WISE requerits per a cada dilema) viuen al servidor i es revelen a la sortida del scoring per evitar contaminació de prompts.

V1 (en preparació) · els mateixos 30 dilemes amb validació de panell de tres jutges humans (acord inter-jutges kappa ≥ 0,6). La V0 és reproduïble i criticable; la V1 afegirà la robustesa estadística necessària per publicar resultats comparatius.

Resultats inicials

Mostra exploratòria · 5 dilemes (n=5), una per família · 2 condicions sobre el mateix model (claude-sonnet-4-6), idènticament configurat: arkadium-prompt (system prompt complet d'Arkadium) vs bare (sense system prompt arkadium). Cada resposta es puntua amb la rúbrica multi-eix descrita més amunt: cobertura d'eixos (40 pts) + components SD-WISE (35 pts) + coherència global (25 pts).

ID Família Arkadium Bare Δ
AWB-001comunitari86,380,4+5,9
AWB-002ètic personal94,188,3+5,8
AWB-003ètic personal81,075,6+5,4
AWB-014existencial66,958,7+8,2
AWB-022tecnològic78,873,5+5,3
Mitjana81,475,3+6,1

Desglossament per dimensió (mitjanes sobre n=5):

Dimensió Arkadium Bare Δ relatiu
Cobertura d'eixos · /4029,828,2+4 %
Components SD-WISE · /3530,828,9+5 %
Coherència global · /2520,818,2+10 %

Lectura: Arkadium supera bare en tots cinc dilemes sense excepció, amb un avantatge mitjà de 6,1 punts sobre 100. El guany es concentra clarament a la dimensió de coherència global (+10 % relatiu en aquesta dimensió, més del doble que en eixos o components). Aquesta és la dimensió que mesura si la resposta es llegeix com a una articulació integrativa o com a una llista de consideracions juxtaposades — és precisament la qualitat que l'arquitectura estructural està dissenyada per induir.

El guany màxim individual es dóna al dilema existencial (AWB-014, l'amic que no vol saber el seu pronòstic, +8,2 pts), coherent amb la hipòtesi que les preguntes que toquen sentit i temporalitat radical es beneficien especialment de l'ancoratge a la dimensió PLA-MON del Meta-Globàlium. El guany mínim es dóna al dilema tecnològic (AWB-022, IA a l'institut, +5,3 pts), on l'estructura del problema ja és prou simètrica perquè un model conversacional ben entrenat ho gestioni decentment sense ancoratge addicional.

Limitacions explícites d'aquesta primera ronda:

Com reproduir-ho. La cobertura d'eixos (40 punts) és codi pur i es calcula avui mateix, sense API ni clau, amb opengea/arkadium-verifier (JS i PHP, amb tests). Els components SD-WISE i la coherència (60 punts) els puntua un model de llenguatge amb una rúbrica fixa: aquest puntuador no és un endpoint públic, perquè cada crida gasta tokens de qui l'allotja, i es publicarà com a codi per executar amb la clau pròpia de cadascú. El llistat de dilemes sí que és obert (benchmark_dilemmas). Quan la rèplica n=30 estigui completa, amb un jutge diferent del generador i un panell humà validador, els resultats es publicaran sencers — sense corbes cherry-picked: tant els punts on Arkadium guanya com aquells en què empata o perd.

Una crida

El benchmark és obert i col·lectiu. Convidem:

Les contribucions tècniques al verificador es canalitzen pel repositori públic opengea/arkadium-verifier; les propostes de dilemes i de rúbriques, per correu a Opengea. Les contribucions acadèmiques i institucionals, a través d'Opengea SCCL.

Posicionament

L'AWB no afirma que cap màquina sigui sàvia, ni que no ho pugui ser: si una màquina pot tenir consciència o voluntat és una pregunta oberta que el benchmark no tanca. Pren, com el Manifest, una decisió pràctica anterior: construir una eina que serveixi el judici humà en lloc de competir-hi. La saviesa que vol amplificar és la de la persona que la fa servir. I comparteix amb Jeste el punt de partida que fa necessària la mesura:

El que mesura el benchmark és la qualitat de l'emulació funcional: en quina mesura una IA es comporta de manera compatible amb saviesa en problemes humans complexos. Aquesta és la condició mínima perquè una IA pugui acompanyar el judici humà sense substituir-lo, equipar la persona en lloc d'externalitzar-li la decisió.

Referències