Tendencias SaaS

Thomson Reuters lanza Thomson, su primer modelo de IA propio para trabajo legal

La compañía gastó unos 40 millones de dólares en dos años, pero el entrenamiento final le costó cerca de 450.000 porque partió de un modelo de pesos abiertos en vez de construir uno desde cero.

6 min de lecturaFuente: SiliconANGLE
Edificio corporativo de Thomson Reuters, compañía que lanzó Thomson, su primer modelo de IA propio para trabajo legal
Imagen: SiliconANGLE

La noticia en 30 segundos

Thomson Reuters lanzó Thomson, su primer modelo de lenguaje propio, entrenado sobre su archivo legal para operar dentro del asistente CoCounsel Legal. La compañía gastó cerca de 40 millones de dólares en dos años entre equipo y cómputo, pero el entrenamiento final costó alrededor de 450.000 dólares, porque partió de un modelo de pesos abiertos en lugar de construir una base desde cero. CoCounsel sigue siendo multimodelo: Thomson será el modelo por defecto solo en análisis tabular de documentos y los administradores podrán elegir otros.

Thomson Reuters lanzó Thomson, su primer modelo de lenguaje propietario, que combina su archivo de conocimiento legal con modelos de terceros para entregar asesoría jurídica. El modelo se despliega primero en Tabular Analysis, la capacidad de revisión documental de alto volumen dentro de su asistente CoCounsel Legal.

CoCounsel se mantiene como un producto multimodelo: usará Thomson donde el modelo de dominio tiene ventaja y modelos frontera de terceros para el resto. Thomson será el modelo por defecto en Tabular Analysis, aunque los administradores podrán seleccionar otros.

¿Por qué el entrenamiento final costó solo 450.000 dólares?

Esta es la cifra que importa. Thomson Reuters invirtió cerca de 40 millones de dólares en dos años entre personas y cómputo, pero las economías del proceso redujeron el costo de la corrida final de entrenamiento a unos 450.000 dólares. En vez de construir un modelo fundacional desde cero, la compañía partió de un modelo de pesos abiertos y le sumó su contenido propietario, sus métodos de entrenamiento y la experiencia de sus profesionales. Según la empresa, el enfoque bajó tanto los costos de entrenamiento como los de inferencia frente a modelos de propósito general.

El proceso incluyó realinear el modelo base con los valores de la compañía, preentrenamiento sobre su contenido, post-entrenamiento dirigido por profesionales y aprendizaje por refuerzo para que el modelo trabajara con herramientas propias como Westlaw y Practical Law. Westlaw reúne más de 40.000 bases de datos individuales y más de 150 años de publicación y curaduría editorial legal. Cientos de expertos ayudaron a definir objetivos de entrenamiento, crear ejemplos y juzgar respuestas en comparaciones ciegas.

¿Compite con los laboratorios frontera?

No, y la compañía lo dice explícitamente. «Thomson necesita marcar la frontera de la inteligencia para lo legal», señaló Joel Hron, director global de inteligencia artificial y de TR Labs en Thomson Reuters. «Ese es un trabajo distinto al que creo que están haciendo muchos de los laboratorios frontera».

Jonathan Schwartz, jefe de investigación fundacional, advirtió que la especialización puede dañar las capacidades generales de un modelo si se maneja mal, por lo que el equipo se concentró en aprendizaje continuo: agregar habilidades de dominio sin borrar las existentes. «Si simplemente tomas el modelo open source sin ninguno de estos pasos adicionales, no sabrá tanto», dijo.

¿Qué tan bueno es? Lo que dicen las pruebas

Según Andrew Bean, investigador senior de la compañía, las pruebas internas mostraron que Thomson es ampliamente competitivo con los modelos líderes cuando todos tienen acceso solo a la web, y pasa a un desempeño aproximadamente igual o levemente superior cuando se conecta al contenido de Thomson Reuters. Las pruebas midieron tanto la completitud de las respuestas como si las citas respaldaban efectivamente lo afirmado.

Con una advertencia importante: esos resultados aún no tienen validación independiente extensa. La compañía empezó a compartir el modelo con expertos legales e instituciones académicas y planea liberar una versión más pequeña de pesos abiertos en Hugging Face bajo licencia académica no comercial. También desarrolla un portal para que desarrolladores externos pidan claves de API y prueben el modelo directamente.

Bean señaló que solo se ha usado cerca del 10% de la base total de información de la compañía. El siguiente paso no es sumar más material sino convertir el contenido más útil y la actividad de producto en mejores señales de entrenamiento.

La propiedad también es central en el argumento de IA soberana: Thomson Reuters afirma que los datos de sus clientes no se usan para entrenar el modelo y que controlarlo le da más autoridad sobre despliegue, gobernanza y desarrollo futuro. Está conversando acceso directo al modelo con grandes estudios y corporaciones, y abre la posibilidad de que los clientes adapten Thomson a su propio conocimiento y flujos de trabajo. Es una discusión que ya llega a los equipos legales y de cumplimiento de empresas grandes en Chile y el resto de Latinoamérica, donde la pregunta por dónde vive el dato pesa tanto como la capacidad del modelo.

Análisis de Revenue Hub

El titular es el modelo. La noticia es el precio. Un incumbente con 150 años de contenido curado convirtió su archivo en un modelo competitivo por 450.000 dólares de corrida final. Eso reordena la respuesta a una pregunta que hoy tiene sobre la mesa cualquier SaaS vertical en Chile y Latinoamérica: si construir sobre APIs de terceros o entrenar algo propio. Hace dieciocho meses la respuesta era obvia. Ya no lo es.

Pero el dato barato esconde el dato caro. Los 450.000 dólares son la corrida final; los 40 millones fueron dos años de personas y cómputo, y ninguno de los dos compra lo que realmente sostiene a este modelo: 40.000 bases de datos y siglo y medio de curaduría editorial. La ventaja no es el entrenamiento, es el corpus propietario. Un SaaS que no tiene un archivo defendible no obtiene esta ventaja gastando lo mismo, obtiene un modelo mediocre más caro que la API que ya estaba usando.

La decisión práctica para un fundador o líder comercial B2B es anterior a la técnica: preguntarse si su empresa acumula datos que nadie más puede replicar. Historial de transacciones de un nicho, taxonomías propias, decisiones y resultados etiquetados por expertos internos. Si la respuesta es sí, empezar a estructurar ese activo hoy vale más que cualquier piloto de IA. Si es no, la vía correcta sigue siendo comprar inteligencia y diferenciarse en el flujo de trabajo, no en el modelo. Puedes seguir cómo se mueve el software B2B en Tendencias SaaS y ver nuestros análisis de fondo en el blog de Revenue Hub.

Fuente y criterio editorial

Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a SiliconANGLE.

Leer la fuente original

Para profundizar

Preguntas frecuentes

¿Qué es Thomson, el modelo de IA de Thomson Reuters?

Es el primer modelo de lenguaje propietario de Thomson Reuters, entrenado sobre su archivo de conocimiento legal. Se despliega primero en Tabular Analysis, la revisión documental de alto volumen del asistente CoCounsel Legal.

¿Cuánto costó entrenar el modelo Thomson?

La compañía gastó cerca de 40 millones de dólares en dos años entre personas y cómputo, pero la corrida final de entrenamiento costó alrededor de 450.000 dólares, porque partió de un modelo de pesos abiertos en lugar de construir uno desde cero.

¿Thomson reemplaza a los modelos de OpenAI o Anthropic dentro de CoCounsel?

No. CoCounsel sigue siendo multimodelo: usa Thomson donde el modelo de dominio tiene ventaja y modelos frontera de terceros para el resto. Thomson es el modelo por defecto solo en Tabular Analysis y los administradores pueden elegir otros.

¿Con qué datos se entrenó Thomson?

Con el contenido propietario de Thomson Reuters, incluidos activos como Westlaw, que reúne más de 40.000 bases de datos y más de 150 años de publicación y curaduría editorial legal. La compañía afirma que los datos de sus clientes no se usan para entrenar el modelo.

¿Es Thomson mejor que los modelos frontera?

Según pruebas internas de la compañía, es ampliamente competitivo con los modelos líderes cuando todos acceden solo a la web, y aproximadamente igual o levemente superior cuando se conecta al contenido de Thomson Reuters. Esos resultados aún no tienen validación independiente extensa.

¿Se podrá usar el modelo Thomson fuera de CoCounsel?

La compañía planea liberar una versión más pequeña de pesos abiertos en Hugging Face bajo licencia académica no comercial y desarrolla un portal para que desarrolladores externos soliciten claves de API. También conversa acceso directo con grandes estudios y corporaciones.

¿Le conviene a un SaaS B2B de Latinoamérica entrenar su propio modelo?

Solo si posee un corpus de datos que nadie más puede replicar, como historial transaccional de un nicho, taxonomías propias o decisiones etiquetadas por expertos internos. Sin ese activo, el resultado suele ser un modelo mediocre más caro que la API que ya se estaba usando.

¿Qué significa IA soberana en este contexto?

Que la empresa controla el modelo y no solo lo consume. Thomson Reuters argumenta que ser dueña del modelo le da más autoridad sobre despliegue, gobernanza y desarrollo futuro, y le permite garantizar que los datos de clientes no se usan para entrenarlo.

Comparte este análisis con tu equipo

Continúa explorando

Ver toda la categoría