Blog | Estrategia de datos y análisis | | 6 minutos de lectura

Vector en Hadoop 5.0: nuevas funciones que te interesan

Vector en Hadoop 5.0

Actian Vector pasó a llamarse Actian Analytics Engine en 2026.

Hoy anunciamos el lanzamiento de la próxima versión de Actian Vector en Hadoop, con la que ampliamos nuestra compatibilidad con Apache Spark para incluir el acceso directo a los formatos de archivo nativos de Hadoop y una integración más estrecha con las aplicaciones de Spark SQL y Spark R. En esta versión, también incorporamos mejoras de rendimiento, integración con los marcos de seguridad de Hadoop y mejoras administrativas. A continuación, voy a tratar cada uno de estos aspectos con más detalle.

Combinar tablas nativas de Hadoop con tablas vectoriales

En versiones anteriores, Vector in Hadoop requería que los datos se almacenaran en un formato propio que optimizaba el rendimiento de los análisis y ofrecía una gran compresión para reducir la latencia de acceso. Vector in Hadoop 5.0 ofrece la posibilidad de registrar archivos de datos de Hadoop (como archivos Parquet, ORC y CSV) como tablas en VectorH y de unir estas tablas externas con tablas nativas de Vector. Vector in Hadoop ofrecerá la ejecución analítica más rápida con datos en estos formatos, incluso más rápida que sus propios motores de consulta. Sin embargo, la ejecución de consultas nunca será tan rápida con tablas externas como con los datos nativos de Vector. Si el rendimiento es importante, te recomendamos que cargues esos datos en Vector in Hadoop utilizando nuestro cargador de alta velocidad.

Esta función permite a los clientes que han adoptado un formato de archivo concreto y que desean evitar copiar datos a un formato propietario seguir beneficiándose de la mejora de rendimiento que ofrece VectorH. Los detalles de la prueba de rendimiento de almacenamiento que llevamos a cabo como parte de nuestro artículo para SIGMOD demostraron que el formato de archivo Vector es más eficiente desde el punto de vista del rendimiento de las consultas, la lectura de datos y la compresión de datos. Consulta nuestra entrada del blog, donde se explica con más detalle dicha prueba de rendimiento.

Integración de seguridad de Hadoop para empresas de verdad

Una encuesta de Forrester realizada el año pasado reveló que la seguridad de los datos es la principal preocupación en las implementaciones de Hadoop. Vector en Hadoop proporciona de forma nativa la seguridad de nivel empresarial que cabe esperar de una plataforma EDW madura, es decir, control de acceso discrecional (control sobre quién puede leer, escribir y actualizar qué datos en la base de datos), cifrado de datos en reposo a nivel de columna, cifrado de datos en tránsito, auditoría de seguridad con registros de auditoría accesibles mediante SQL y alertas de seguridad. En el resto del ecosistema de Hadoop, estas preocupaciones han impulsado el desarrollo de marcos de seguridad para Hadoop, a través de proyectos como Apache Knox y Apache Ranger. A medida que vemos que estos marcos empiezan a aparecer en las solicitudes de información (RFI) de los clientes, proporcionamos documentación sobre cómo configurar VectorH para su integración con Apache Knox y Apache Ranger.

Mejoras significativas en el rendimiento

Las mejoras de rendimiento que permitieron a Vector 5.0 alcanzar el máximo rendimiento en la prueba de rendimiento TPC-H de 3000 GB para sistemas no agrupados en clúster ya están disponibles en Vector in Hadoop 5.0, donde solemos observar una escalabilidad lineal o superior a la lineal.

Generación automática de histogramas

Los planes de ejecución de consultas de bases de datos dependen en gran medida del conocimiento de los datos subyacentes; sin estadísticas de datos, el sistema tiene que hacer suposiciones sobre la distribución de los datos; por ejemplo, asumirá que todos los códigos postales tienen el mismo número de residentes, o que los apellidos de los clientes tienen la misma probabilidad de empezar por una «X» que por una «M». VectorH 5.0 incluye una implementación de generación automática de estadísticas e histogramas para tablas Vector. Esto hace que los histogramas se creen automáticamente y se almacenen en caché en memoria cuando una consulta contiene una referencia a una columna en una cláusula WHERE, HAVING u ON sin un histograma creado explícitamente (mediante optimizedb o CREATE STATISTICS).

Acelera el arranque y el apagado con el registro de escritura anticipada distribuido

En versiones anteriores de Vector en Hadoop, el archivo de registro de escritura anticipada (WAL), que contiene los detalles de las actualizaciones del sistema, se gestionaba en el nodo líder de VectorH. Este archivo de registro, que residía en memoria, consumía gran parte de la memoria del nodo líder y se convertía en un cuello de botella durante el arranque, ya que era necesario reproducir el archivo de registro durante el arranque y ese proceso podía tardar varios minutos. En VectorH 5.0 hemos implementado un archivo de registro de escritura anticipada (WAL) distribuido, en el que cada nodo cuenta con un WAL local. Esto alivia la presión sobre la memoria, mejora nuestros tiempos de arranque y, como efecto secundario, también se traduce en un procesamiento de COMMIT mucho más rápido.

Acelerar las consultas con índices distribuidos

En versiones anteriores, el nodo líder de VectorH se encargaba de mantener los índices min-max automáticos para todas las particiones. A modo de recordatorio, el índice min-max lleva un registro de los valores mínimo y máximo almacenados en un bloque de datos; este índice interno nos permite identificar rápidamente qué bloques participarán en la resolución de una consulta y cuáles no es necesario leer. Este índice reside en memoria y se crea al iniciar el servidor. En VectorH 5.0, cada nodo se encarga de mantener su propia parte del índice, lo que alivia la presión sobre la memoria del nodo líder, mejora los tiempos de arranque al distribuir el trabajo y acelera las consultas DML.

Gestión simplificada de particiones con especificación de particiones

Hemos observado que varios clientes de VectorH han tenido problemas de rendimiento porque no sabían que debían incluir la cláusula PARTITION al crear tablas, especialmente al utilizar CREATE TABLE AS SELECT (CTAS). Supongamos, por ejemplo, que tenían una tabla existente distribuida en 15 particiones y querían crear una nueva tabla basada en esa tabla original; su suposición era que esta también tendría 15 particiones, pero ese no es el propósito del estándar SQL y, en este caso, ceñirnos al estándar SQL nos perjudicó. Para paliar esto, hemos añadido un parámetro de configuración que puede establecerse para exigir el uso de NOPARTITION o PARTITION= al crear una tabla vectorial de forma explícita o mediante CTAS.

Simplifica las copias de seguridad y la restauración mediante la clonación de bases de datos

VectorH 5.0 introduce una nueva utilidad, clonedb, que permite a los usuarios realizar una copia exacta de su base de datos en una instancia independiente de Vector; por ejemplo, copiar una base de datos de producción a un entorno de desarrollo con fines de prueba. Esta función fue solicitada por uno de nuestros clientes actuales, pero ha tenido una excelente acogida entre todas las cuentas de Vector/VectorH.

Exportaciones más rápidas gracias a la descarga paralela de Spark Connector

Ahora es posible utilizar el Vector Spark Connector para descargar grandes volúmenes de datos en paralelo en todos los nodos.

Carga simplificada con sintaxis SQL para vwload

VectorH 5.0 permite utilizar vwload junto con la instrucción SQL COPY para realizar una carga rápida y paralela de datos desde SQL.

Creación simplificada de exportaciones en formato CSV desde SQL

VectorH 5.0 permite exportar datos en formato CSV desde SQL utilizando la siguiente sintaxis:

INSERT INTO EXTERNAL CSV 'nombre_archivo' SELECT ... [WITH NULL_MARKER='NULL', FIELD_SEPARATOR=',', RECORD_SEPARATOR='n']

Próximos pasos

Para obtener más información, solicita una demostración o una versión de prueba de VectorH para probarla en tu clúster de Hadoop. También puedes explorar la versión para un solo servidor de Actian Vector, que se ejecuta en Linux, se distribuye de forma gratuita como edición comunitaria y está disponible para su descarga.