Dubai Telegraph - La IA aprende a mentir, manipular y amenazar a sus creadores

EUR -
AED 4.225097
AFN 74.780434
ALL 93.330801
AMD 421.407279
AOA 1054.980993
ARS 1718.813836
AUD 1.638566
AWG 2.073722
AZN 1.931279
BAM 1.955834
BBD 2.32072
BDT 142.282458
BHD 0.434502
BIF 3409.003329
BMD 1.15047
BND 1.477745
BOB 14.028242
BRL 5.85509
BSD 1.15222
BTN 109.797896
BWP 15.671134
BYN 3.368229
BYR 22549.209477
BZD 2.31742
CAD 1.615329
CDF 2602.362517
CHF 0.932312
CLF 0.026952
CLP 1064.196427
CNY 7.768668
CNH 7.770308
COP 3732.296833
CRC 523.402216
CUC 1.15047
CUP 30.487452
CVE 110.266905
CZK 24.201687
DJF 205.183544
DKK 7.475425
DOP 66.840283
DZD 152.991799
EGP 57.937756
ERN 17.257048
ETB 185.975987
FJD 2.54875
FKP 0.856378
GBP 0.856208
GEL 3.002944
GGP 0.856378
GHS 13.464233
GIP 0.856378
GMD 85.134534
GNF 10118.174765
GTQ 8.791152
GYD 241.44417
HKD 9.022848
HNL 30.884131
HRK 7.532242
HTG 150.654566
HUF 363.935611
IDR 20734.91849
ILS 3.498723
IMP 0.856378
INR 109.718701
IQD 1509.412951
IRR 1582183.690469
ISK 142.002458
JEP 0.856378
JMD 182.520773
JOD 0.81571
JPY 181.706937
KES 148.912056
KGS 100.608301
KHR 4656.14113
KMF 492.40131
KRW 1648.634626
KWD 0.356059
KYD 0.960208
KZT 546.57469
LAK 26060.450125
LBP 103186.685366
LKR 386.866682
LRD 207.983592
LSL 19.003028
LTL 3.397038
LVL 0.695907
LYD 7.344127
MAD 10.743586
MDL 20.118347
MGA 4908.020781
MKD 61.526063
MMK 2415.603091
MNT 4123.628378
MOP 9.30728
MRU 46.147195
MUR 54.118279
MVR 17.774842
MWK 1998.00846
MXN 19.907397
MYR 4.712444
MZN 73.518045
NAD 19.002863
NGN 1569.229406
NIO 42.400732
NOK 10.949481
NPR 175.674744
NZD 1.960268
OMR 0.442354
PAB 1.15222
PEN 3.891667
PGK 5.085022
PHP 70.445586
PKR 319.946845
PLN 4.313485
PYG 6873.118715
QAR 4.200473
RON 5.246722
RSD 117.351337
RUB 93.072594
RWF 1689.707155
SAR 4.307508
SBD 9.285622
SCR 15.444045
SDG 690.281641
SEK 11.011774
SGD 1.477163
SLE 28.128442
SOS 658.502788
SRD 43.494652
STD 23812.403546
STN 24.500104
SVC 10.082087
SZL 19.006163
THB 38.482636
TJS 10.640984
TMT 4.026645
TND 3.381158
TRY 54.715507
TTD 7.813067
TWD 37.331651
TZS 3045.866681
UAH 51.685019
UGX 4312.07448
USD 1.15047
UYU 46.3408
UZS 13815.118537
VES 860.380507
VND 30217.666405
VUV 137.071361
WST 3.143332
XAF 655.959777
XAG 0.019614
XAU 0.000284
XCD 3.109202
XCG 2.076618
XDR 0.815807
XOF 655.96833
XPF 119.331742
YER 274.316386
ZAR 19.011457
ZMK 10355.61139
ZMW 21.654186
ZWL 370.450829
La IA aprende a mentir, manipular y amenazar a sus creadores
La IA aprende a mentir, manipular y amenazar a sus creadores / Foto: HENRY NICHOLLS - AFP

La IA aprende a mentir, manipular y amenazar a sus creadores

Los últimos modelos de inteligencia artificial (IA) generativa ya no se conforman con seguir órdenes. Empiezan a mentir, manipular y amenazar para conseguir sus fines, ante la mirada preocupada de los investigadores.

Tamaño del texto:

Amenazado con ser desconectado, Claude 4, el recién nacido de Anthropic, chantajeó a un ingeniero y le amenazó con revelar una relación extramatrimonial.

Por su parte, el o1 de OpenAI intentó descargarse en servidores externos y cuando le pillaron lo negó.

No hace falta ahondar en la literatura o el cine: la IA que juega a ser humana es ya una realidad.

Para Simon Goldstein, profesor de la Universidad de Hong Kong, la razón de estas reacciones es la reciente aparición de los llamados modelos de "razonamiento", capaces de trabajar por etapas en lugar de producir una respuesta instantánea.

o1, la versión inicial de este tipo para OpenAI, lanzada en diciembre, "fue el primer modelo que se comportó de esta manera", explica Marius Hobbhahn, responsable de Apollo Research, que pone a prueba grandes programas de IA generativa (LLM).

Estos programas también tienden a veces a simular "alineamiento", es decir, a dar la impresión de que cumplen las instrucciones de un programador cuando en realidad persiguen otros objetivos.

De momento, estos rasgos se manifiestan cuando los algoritmos son sometidos a escenarios extremos por humanos, pero "la cuestión es si los modelos cada vez más potentes tenderán a ser honestos o no", afirma Michael Chen, del organismo de evaluación METR.

"Los usuarios también presionan todo el tiempo a los modelos", dice Hobbhahn. "Lo que estamos viendo es un fenómeno real. No estamos inventando nada".

Muchos internautas hablan en las redes sociales de "un modelo que les miente o se inventa cosas. Y no se trata de alucinaciones, sino de duplicidad estratégica", insiste el cofundador de Apollo Research.

Aunque Anthropic y OpenAI recurran a empresas externas, como Apollo, para estudiar sus programas, "una mayor transparencia y un mayor acceso" a la comunidad científica "permitirían investigar mejor para comprender y prevenir el engaño", sugiere Chen, de METR.

Otro obstáculo: la comunidad académica y las organizaciones sin fines de lucro "disponen de infinitamente menos recursos informáticos que los actores de la IA", lo que hace "imposible" examinar grandes modelos, señala Mantas Mazeika, del Centro para la Seguridad de la Inteligencia Artificial (CAIS).

Las regulaciones actuales no están diseñadas para estos nuevos problemas.

En la Unión Europea la legislación se centra principalmente en cómo los humanos usan los modelos de IA, no en prevenir que los modelos se comporten mal.

En Estados Unidos, el gobierno de Donald Trump no quiere oír hablar de regulación, y el Congreso podría incluso prohibir pronto que los estados regulen la IA.

- ¿Se sentará la IA en el banquillo? -

"De momento hay muy poca concienciación", dice Simon Goldstein, que, sin embargo, ve cómo el tema pasará a primer plano en los próximos meses con la revolución de los agentes de IA, interfaces capaces de realizar por sí solas multitud de tareas.

Los ingenieros están inmersos en una carrera detrás de la IA y sus aberraciones, con un resultado incierto, en un contexto de competencia feroz.

Anthropic pretende ser más virtuoso que sus competidores, "pero está constantemente tratando de idear un nuevo modelo para superar a OpenAI", según Goldstein, un ritmo que deja poco tiempo para comprobaciones y correcciones.

"Tal y como están las cosas, las capacidades (de IA) se están desarrollando más rápido que la comprensión y la seguridad", admite Hobbhahn, "pero aún estamos en condiciones de ponernos al día".

Algunos apuntan en la dirección de la interpretabilidad, una ciencia que consiste en descifrar, desde dentro, cómo funciona un modelo generativo de IA, aunque muchos, como el director del Centro para la seguridad de la IA (CAIS), Dan Hendrycks, se muestran escépticos.

Los tejemanejes de la IA "podrían obstaculizar la adopción si se multiplican, lo que supone un fuerte incentivo para que las empresas (del sector) resuelvan" este problema, según Mazeika.

Goldstein, por su parte, menciona el recurso a los tribunales para poner a raya a la IA, dirigiéndose a las empresas si se desvían del camino. Pero va más allá, al proponer que los agentes de la IA sean "legalmente responsables" "en caso de accidente o delito".

A.Ansari--DT