-
Correo electrónico
service@h3c.com
- Teléfono
-
Dirección
H3C company, 466 Changhe road, Binjiang district, Hangzhou
Miembros
¿¿ qué?Ayuda
¿¿ qué?Xinhuansan Technology co., Ltd.
service@h3c.com
H3C company, 466 Changhe road, Binjiang district, Hangzhou
Con el fin de ayudar a los clientes de todos los ámbitos de la vida a hacer frente a los desafíos planteados por la era del Big data, H3C ha creado una plataforma de procesamiento de Big data de alto rendimiento, que utiliza un marco informático de integración de bases de datos distribuidas hadoop y MPP para proporcionar a los usuarios soluciones completas de Plataforma de Big data, incluyendo una serie completa de funciones como conversión de conjuntos de adquisición de datos, computación de almacenamiento, minería de análisis, intercambio compartido, exhibición BI y gestión de operaciones y mantenimiento, para ayudar a los usuarios a construir sistemas de procesamiento de datos masivos, descubrir el valor intrínseco de los datos y obtener nuevas oportunidades de mercado.

Seaql MPP admite el despliegue de máquinas físicas locales, así como el despliegue en la nube privada, y la fuente de datos puede ser almacenamiento local, HDFS、 Almacenamiento en la nube u otras bases de datos relacionales como oracle, mysql, etc., estos datos se integran en la base de datos seaql MPP a través de herramientas ETL o kafka, etc. La base de datos distribuida seaql MPP se basa en una arquitectura paralela a gran escala sin compartir, con capacidad de procesamiento de datos a nivel pb, y el núcleo se basa en el núcleo postgreql, que ha optimizado mucho, proporcionando un potente optimizador de consultas y haciendo una compatibilidad perfecta con sql. En la capa de interfaz, seaql mpp, además de proporcionar una interfaz JDBC / Odbc estándar, también proporciona una interfaz para el lenguaje de programación común Python / R / Java / perl / c, así como una interfaz para la Biblioteca de Aprendizaje automático madlib, recuperación de texto completo y postgis, y proporciona llamadas de capa.

Seaql MPP es una arquitectura distribuida con una fuerte capacidad de expansión horizontal, que puede lograr la interconexión de miles de nodos y soportar miles de cpu. Su potente capacidad de procesamiento y cálculo de datos se aplica a los siguientes escenarios:
• adecuado para aplicaciones orientadas al análisis, como la construcción de ODS / edw a nivel empresarial, ferias de datos, etc.
• adecuado para aplicaciones que requieren el procesamiento de datos masivos, como almacenes de datos, inteligencia empresarial, etc.
• Análisis y minería de datos adecuados para datos fuera de línea, como análisis de comportamiento del cliente, retratos de personajes, modelado de predicción de comportamiento, etc.
H3C seaql MPP es una base de datos distribuida basada en postgreql, que utiliza la arquitectura compartida - nada, el host, el sistema operativo, la memoria y el almacenamiento son autocontrol y no hay compartir. Las principales características de la base de datos MPP H3C seaql son las siguientes:
· arquitectura de procesamiento paralelo a gran escala.
· apoyar tanto el depósito bancario como el depósito bancario. Cada tabla o división de tabla puede ser almacenada y comprimida por el Administrador según las necesidades de la Aplicación.
· admite una variedad de métodos de compresión, incluyendo zlib, rle, etc.
· admite tablas de División de varios niveles, y la División admite una variedad de modos, incluyendo alcance, lista, etc.
· admite índices como árboles b, mapas de bits y gist.
· El mecanismo de autenticación admite múltiples formas, incluyendo LDAP y kerberos, entre otras.
· soporte de lenguaje extendido: seaql MPP admite el uso de varios lenguajes populares para implementar funciones personalizadas por el usuario, incluyendo python, r, java, perl, C / C +, etc.
· procesamiento de información geográfica: a través de la integración de postgis, seaql MPP admite el almacenamiento y análisis de información geográfica.
· Biblioteca de algoritmos de minería de datos incorporada: a través de la Biblioteca de algoritmos madlib (ahora proyecto de incubación apache), se pueden construir docenas de algoritmos comunes de análisis de datos y minería en la base de datos seaql mpp, incluyendo regresión lógica, árbol de decisiones, bosque aleatorio, etc. No es necesario escribir ningún código de algoritmo, se pueden usar todos los algoritmos a través de sql.
· recuperación de texto: seaql MPP puede soportar funciones de recuperación de texto completo eficientes, flexibles y ricas. Junto con madlib, se puede realizar análisis de texto paralelos y minería.
· carga de alto rendimiento, utilizando la tecnología mpp, para proporcionar el rendimiento de carga de la cantidad de datos de nivel petabyte.
· optimización de consultas de flujo de trabajo de Big data.
· almacenamiento y ejecución de datos polimórficos.
· capacidad avanzada de Aprendizaje automático basada en Apache madlib.
· soporte para los estándares ANSI / ISO 92, ANSI / ISO 99, ANSI / ISO 2003, ANSI / ISO 2006, ANSI / ISO 2006, API c, odbc, JDBC y otras especificaciones de interfaz internacional, soporte para ddl, dml, gramática dcl, soporte para tipos de datos básicos, restricciones básicas de integridad, gestión de tablas básicas, condiciones de búsqueda, conexión de tablas, subconsulta, inserción, modificación, eliminación, control de transacciones.
Seaql MPP admite el despliegue e instalación de la plataforma en la nube cloudeos 5.0 y puede soportar el despliegue en la nube. Los usuarios pueden controlar todos los recursos de manera unificada y programar y gestionar de manera unificada a través de la interfaz cloudos, que puede gestionar y asignar recursos de manera flexible y mejorar la utilización general de los recursos.

La base de datos seaql MPP puede realizar dos métodos de expansión de acuerdo con las necesidades del cliente: expansión del host y expansión de instancia. En el proceso de expansión, solo es necesario actualizar los metadatos de la tabla del sistema para completar la expansión, no es necesario detener la operación de la base de datos, después de la expansión de la base de datos, se utiliza el algoritmo Jump consistent hash para reducir en gran medida el Movimiento de datos durante el proceso de redistribución de datos.
La base de datos seaql MPP ofrece varios tipos de modelos de almacenamiento: almacenamiento de filas, almacenamiento de columnas, almacenamiento mixto de filas y filas, que puede desarrollar un modo de almacenamiento de datos de acuerdo con las necesidades del negocio.

Seaql MPP ofrece funciones OLAP ricas en: rollup, cube, funciones de ventana, operaciones recurrentes, etc., para apoyar operaciones de análisis complejas, centrándose en el soporte de decisiones para tomadores de decisiones y altos directivos. De acuerdo con los requisitos de los analistas, el procesamiento de consultas complejas de Big data se puede llevar a cabo de manera rápida y flexible, para que puedan comprender con precisión la situación operativa de la empresa, comprender las necesidades de los clientes y formular el plan correcto.
Las características de múltiples inquilinos de la base de datos seaql MPP pueden dividir una base de datos en varios inquilinos para su uso. los recursos físicos de los diferentes inquilinos están aislados entre sí. las características de múltiples inquilinos reflejan principalmente las siguientes ventajas:
Los requisitos para los recursos físicos varían de un inquilino a otro, y los recursos están aislados y no interfieren entre sí para evitar que algunos inquilinos se apoderen de los recursos de otros usuarios en el pico del negocio.
Los datos entre inquilinos están aislados entre sí, lo que mejora la seguridad de los datos.
Los recursos de la CPU y la memoria del sistema se pueden utilizar de manera flexible cuando los recursos están ociosos, y los recursos entre inquilinos cuando los recursos están más ocupados se limitan de acuerdo con los parámetros en el momento de la configuración, lo que mejora la utilización de los recursos de todo el sistema.
Los indicadores de rendimiento de importación de datos juegan un papel importante en la experiencia de uso del almacén de datos. la base de datos seaql MPP puede utilizar los recursos de todos los nodos de todo el clúster al cargar datos. el rendimiento de carga aumenta linealmente con el aumento del número de nodos. en un clúster a gran escala, la tasa de carga de datos puede alcanzar los 20 TB / hora.
Madlib no está orientado a programadores, sino al desarrollo de bases de datos o dba, que puede combinar la facilidad de uso de SQL con algoritmos complejos de minería de datos, aprovechar al máximo las ventajas y características de los dos y mejorar en gran medida la eficiencia del desarrollo de los desarrolladores.
Para los usuarios, madlib proporciona funciones que se pueden llamar en sentencias de consulta sql, que incluyen no solo operaciones aritméticas lineales básicas y funciones estadísticas, sino también funciones de modelo de Aprendizaje automático o minería de datos comunes y listas para usar. Los usuarios no necesitan comprender en profundidad los detalles de la implementación del programa del algoritmo, solo necesitan aclarar el uso de la función, lo que mejora en gran medida la eficiencia del desarrollo y ahorra costos de desarrollo.

POSTGIS es una extensión del sistema de base de datos relacionales de objetos postgreql, que convierte el sistema de gestión de base de datos postgreql en una base de datos espacial agregando soporte a postgreql para tipos de datos espaciales, índices espaciales y funciones espaciales.
Seaql MPP integra la base de datos espacial POSTGIS para integrar completamente los datos espaciales y la base de datos de Relaciones con objetos, logrando la transformación de GIS como centro a base de datos como centro. De esta manera, los usuarios no necesitan un motor de datos GIS especial para procesar y manipular datos espaciales, y las aplicaciones solo necesitan usar el lenguaje SQL para manipular fácilmente datos espaciales.
El módulo de cifrado transparente seaql MPP realiza el cifrado de toda la base de datos, que es completamente imperceptible para el cliente. Al escribir el bloque de datos en el disco, cifrar los datos; Al leer los datos del disco, se descifra. Puede garantizar que los datos almacenados en el disco siempre estén encriptados y que los datos de texto plano en el interior no se puedan leer incluso si se obtiene el contenido del Disco. Al mismo tiempo, el nivel empresarial no es consciente de las acciones de cifrado en absoluto, y no es necesario realizar ninguna modificación de adaptación para el cifrado. El método de cifrado adopta el modo de cifrado xts de aes, lo que garantiza la seguridad del cifrado de datos.
Desensibilización de datos, también conocida como blanqueamiento de datos, desprivacidad de datos o deformación de datos. Se refiere a la deformación de algunos datos sensibles a través de reglas de desensibilización para lograr una protección confiable de los datos de privacidad sensibles. Cuando se trata de datos de seguridad del cliente o algunos datos comercialmente sensibles, sin violar las reglas del sistema, los datos reales se transforman y se proporcionan para su uso de prueba, como el número de identificación, el número de teléfono móvil, el número de tarjeta, el número de cliente y otra información personal requiere desensibilización de datos.
La base de datos seaql MPP ofrece una variedad de métodos de desensibilización. después de definir las reglas de desensibilización, los usuarios pueden acceder a los datos de desensibilización de las siguientes dos maneras:
·Desensibilización estática:Eliminando la información sensible en la biblioteca, los datos sensibles en la base de datos están cubiertos y no se pueden restaurar.
·Desensibilización dinámica:Bloquear la información sensible para los usuarios designados, otros usuarios que no hayan sido desensibilizados todavía tendrán acceso a los datos originales.
Fdw es la implementación del estándar SQL / MED (gestión SQL de datos externos). Fdw proporciona una serie de interfaces públicas unificadas que permiten a los programas de expansión integrarse fácilmente en las partes centrales de optimización, ejecución, escaneo, actualización y estadísticas y seaql en profundidad, lo que permite consultar y operar fuentes de datos externas directamente con sentencias sql. Por ejemplo, fdw para mysql, los usuarios pueden consultar, ordenar, agrupar, filtrar, unirse e incluso insertar y actualizar los datos de la base de Datos Mysql directamente como si estuvieran operando tablas locales.
Según la fuente de datos, los módulos fdw implementados por seaql incluyen: postgres_fdw、file_fdw、oracle_fdw、mysql_fdw、json_fdw、redis_fdw、hdfs_dfw, Como se muestra en la siguiente imagen:

Roaringbitmap es un algoritmo eficiente de compresión de mapas de bits, que puede mejorar efectivamente la eficiencia del uso de la memoria de mapas de bits y resolver el problema de que los mapas de bits escasos no se adaptan al almacenamiento escaso. La computación de bits bitmap es muy adecuada para la computación de base de Big data, y se utiliza comúnmente en la eliminación de peso, filtrado de etiquetas, series temporales y otros cálculos. El plug - in gpdb roaringbitmap integra la función roaringbitmap en la base de datos seaql mpp, proporcionando soporte nativo para funciones de base de datos, operadores, agregaciones y otras funciones como un tipo de datos.