Mostrando entradas con la etiqueta trabajos. Mostrar todas las entradas
Mostrando entradas con la etiqueta trabajos. Mostrar todas las entradas

miércoles, 13 de agosto de 2014

Diferencias entre las TRANSFORMACIONES y los TRABAJOS

Las TRANSFORMACIONES(TRANSFORMATION) son secuencias simples de pasos para transformar filas de entrada en filas de salida


Los TRABAJOS (JOBS) son secuencias que pueden incluir:

  • Ejecución de las TRANSFORMACIONES (TRANSFORMATION)
  • Envió de correos por alguna falla
  • Carga o Descarga de Archivos / Ficheros via FTP
Tener presente lo siguiente:

  • Los pasos de una TRANSFORMACION (TRANSFORMATION) se ejecutan en forma paralela (cuando sea posible) 
  • Los pasos de un TRABAJO (JOB) se ejecutan siempre en forma secuancial

Ejemplo de una Transformación:
https://drive.google.com/file/d/0B39B21iTAG9lRjVPS3lScmkwLVU/edit?usp=sharing






lunes, 11 de agosto de 2014

Primeros Pasos como ejecutar KITCHE y PAN desde consola (TERMINAL)

Para poder ejecutar el comando correspondiente, es necesario ir a la CARPETA de data-integrartor

En Ubuntu Linux:

Se debe de ir a la CARPETA correspondiente:  juan@Ubuntu-desktop: cd  /data-integrator [ENTER]

Digitar lo siguiente para KITCHEN y obtendremos los siguientes comandos para utilizar


Debemos colocar el comando con el JOB correspondiente para ejecutarlo
juan@Ubuntu-desktop:~/data-integration$ ./kitchen.sh

Digitar lo siguiente para PAN y obtendremos los siguientes comandos para utilizar


# Archivo a ejecutar : agregarConstante.ktr

Debemos colocar el comando con la TRANSFORMACION correspondiente para ejecutarlo
juan@Ubuntu-desktop:~/data-integration$ 
  • ./pan.sh /file agregarConstante.ktr /level:Basic 
  • ./pan.sh /file /norep agregarConstante.ktr /level:Basic
Descargar Ejemplo: https://www.dropbox.com/s/se80toejuyfmeds/agregarConstante.ktr






martes, 15 de julio de 2014

Que es SPOON de Pentaho

SPOON. Es el diseñador gráfico de transformaciones y trabajos del sistema de ETTLs de Pentaho Data Integration (PDI).

También se le conoce como Kettle (acrónimo recursivo: "Kettle Extraction, Transformation, Transportation, and Load Environment ").

Está diseñado para ayudar en los procesos ETTLs, que incluyen la Extracción, Transformación, Transporte y Carga de datos. Spoon es una Interfaz Gráfica de Usuario (GUI), que permite diseñar transformaciones y trabajos que se pueden ejecutar con las herramientas de Kettle (Pan y Kitchen).

  • Pan es un motor de transformación de datos que realiza muchas funciones tales como lectura, manipulación, y escritura de datos hacia y desde varias fuentes de datos.
  • Kitchen es un programa que ejecuta los trabajos diseñados por Spoon en XML o en un catálogo de base de datos.


Los Trabajos normalmente se planifican en modo batch (por lotes) para ejecutarlos automáticamente en intervalos regulares.

Las Transformaciones y Trabajos se pueden describir usando un archivo XML o se pueden colocar en un catálogo de base de datos de Kettle.

Kitchen permite ejecutar los JOBS realizados en SPOON, permitiendo programarlos y ejecutarlos en modo BATCH (en consola).

Pan
 permite ejecutar TRANSFORMACIONES  diseñados en SPOON, permitiendo ejecutarlos desde la linea de comandos y ejecutados en BATCH (en consola).


Se puede descargar desde este enlace: Descargar Pentaho Data Integrator


domingo, 15 de abril de 2012

Usando el ETL de Pentaho

ETL. Son las siglas en inglés de Extraer, Transformar y Cargar (Extract, Transform and  Load).

Es el proceso que permite mover datos desde múltiples fuentes, re formatearlos y limpiarlos, y cargarlos en otra base de datos, datamart, o data warehouse para analizar, o en otro sistema operacional para apoyar un proceso de negocio.

Extraer. La primera parte del proceso ETL consiste en extraer los datos desde los sistemas de origen. La mayoría de los proyectos de almacenamiento de datos fusionan datos provenientes de diferentes sistemas de origen. Por ejemplo la información del área de Operaciones puede estar disponible en una base de datos( SQL Server, MySQL, Oracle, PostgreSQL, etc.), mientras que la información de Ventas esté disponible en hojas de cálculo y en archivos texto.

Transformar. La fase de transformación aplica una serie de reglas de negocio o funciones sobre los datos extraídos para convertirlos en datos que serán cargados. Algunas fuentes de datos requerirán alguna pequeña manipulación de los datos.

No obstante en otros casos pueden ser necesarias aplicar algunas de las siguientes transformaciones:
  • Seleccionar sólo ciertas columnas para su carga (por ejemplo, que las columnas con valores nulos no se carguen).
  • Traducir códigos (por ejemplo, si la fuente almacena una "A" para Activos y "I" para Inactivos pero el destino tiene que guardar "0" para Activo y "1" para Inactivos).
  • Obtener nuevos valores calculados (por ejemplo, TotalVenta = precio * cantidad).
  • Unir datos de múltiples fuentes (por ejemplo, búsquedas, combinaciones, etc.).
  • Generación de campos clave en el destino.
Carga. La fase de carga es el momento en el cual los datos de la fase anterior (transformación) son cargados en el sistema de destino. Este proceso puede abarcar una amplia variedad de acciones diferentes. En algunas BASES DE DATOS se sobrescribe la información antigua con nuevos datos, en otras se agrega a la información ya existente.

Todo depende del modelo y requerimientos del negocio.

La fase de carga interactúa directamente con la base de datos de destino. Al realizar esta operación se aplicarán todas las restricciones y triggers que se hayan definido en ésta (por ejemplo, valores únicos, integridad referencial, campos obligatorios) y si están bien definidos contribuyen a que se garantice la calidad de los datos en el proceso ETL.