{"id":748,"date":"2016-04-27T18:02:28","date_gmt":"2016-04-27T18:02:28","guid":{"rendered":"https:\/\/possibleapp.com\/blog\/?p=748"},"modified":"2016-05-20T17:49:07","modified_gmt":"2016-05-20T17:49:07","slug":"que-es-big-data","status":"publish","type":"post","link":"https:\/\/possibleapp.com\/blog\/2016\/04\/que-es-big-data\/","title":{"rendered":"\u00bfQu\u00e9 es Big Data?"},"content":{"rendered":"<div id=\"ibm-leadspace-body\">\n<p><em>Todos formamos parte de ese gran crecimiento de datos<\/em><\/p>\n<\/div>\n<div id=\"dw-summary-area\" class=\"dw-summary-columns\">\n<div class=\"ibm-col-6-4\">\n<p>Debido al gran avance que existe d\u00eda con d\u00eda en las tecnolog\u00edas de informaci\u00f3n, las organizaciones se han tenido que enfrentar a nuevos desaf\u00edos que les permitan analizar, descubrir y entender m\u00e1s all\u00e1 de lo que sus herramientas tradicionales reportan sobre su informaci\u00f3n, al mismo tiempo que durante los \u00faltimos a\u00f1os el gran crecimiento de las aplicaciones disponibles en internet (geo-referenciamiento, redes sociales, etc.) han sido parte importante en las decisiones de negocio de las empresas. El presente art\u00edculo tiene como prop\u00f3sito introducir al lector en el concepto de Big Data y describir algunas caracter\u00edsticas de los componentes principales que constituyen una soluci\u00f3n de este tipo.<\/p>\n<h2 id=\"1.1.Introducci\u00f3n|outline\">1. Introducci\u00f3n<\/h2>\n<p>El primer cuestionamiento que posiblemente llegue a su mente en este momento es \u00bfQu\u00e9 es Big Data y porqu\u00e9 se ha vuelto tan importante? pues bien, en t\u00e9rminos generales podr\u00edamos referirnos como a la tendencia en el avance de la tecnolog\u00eda que ha abierto las puertas hacia un nuevo enfoque de entendimiento y toma de decisiones, la cual es utilizada para describir enormes cantidades de datos (estructurados, no estructurados y semi estructurados) que tomar\u00eda demasiado tiempo y ser\u00eda muy costoso cargarlos a un base de datos relacional para su an\u00e1lisis. De tal manera que, el concepto de Big Data aplica para toda aquella informaci\u00f3n que no puede ser procesada o analizada utilizando procesos o herramientas tradicionales. Sin embargo, Big Data no se refiere a alguna cantidad en espec\u00edfico, ya que es usualmente utilizado cuando se habla en t\u00e9rminos de petabytes y exabytes de datos. Entonces \u00bfCu\u00e1nto es demasiada informaci\u00f3n de manera que sea elegible para ser procesada y analizada utilizando Big Data? Analicemos primeramente en t\u00e9rminos de bytes:<\/p>\n<p><em>Gigabyte = 10<sup>9<\/sup> = 1,000,000,000<br \/>\nTerabyte = 10<sup>12<\/sup> = 1,000,000,000,000<br \/>\nPetabyte = 10<sup>15<\/sup> = 1,000,000,000,000,000<br \/>\nExabyte = 10<sup>18<\/sup> = 1,000,000,000,000,000,000<\/em><\/p>\n<p>Adem\u00e1s del gran <strong><em>volumen<\/em><\/strong> de informaci\u00f3n, esta existe en una gran <strong><em>variedad<\/em><\/strong> de datos que pueden ser representados de diversas maneras en todo el mundo, por ejemplo de dispositivos m\u00f3viles, audio, video, sistemas GPS, incontables sensores digitales en equipos industriales, autom\u00f3viles, medidores el\u00e9ctricos, veletas, anem\u00f3metros, etc., los cuales pueden medir y comunicar el posicionamiento, movimiento, vibraci\u00f3n, temperatura, humedad y hasta los cambios qu\u00edmicos que sufre el aire, de tal forma que las aplicaciones que analizan estos datos requieren que la <strong><em>velocidad<\/em><\/strong> de respuesta sea lo demasiado r\u00e1pida para lograr obtener la informaci\u00f3n correcta en el momento preciso. Estas son las caracter\u00edsticas principales de una oportunidad para Big Data.<\/p>\n<p>Es importante entender que las bases de datos convencionales son una parte importante y relevante para una soluci\u00f3n anal\u00edtica. De hecho, se vuelve mucho m\u00e1s vital cuando se usa en conjunto con la plataforma de Big Data. Pensemos en nuestras manos izquierda y derecha, cada una ofrece fortalezas individuales para cada tarea en espec\u00edfico. Por ejemplo, un beisbolista sabe que una de sus manos es mejor para lanzar la pelota y la otra para atraparla; puede ser que cada mano intente hacer la actividad de la otra, mas sin embargo, el resultado no ser\u00e1 el m\u00e1s \u00f3ptimo.<\/p>\n<h2 id=\"2.2.\u00bfDed\u00f3ndeprovienetodaesainformaci\u00f3n?|outline\">2. \u00bfDe d\u00f3nde proviene toda esa informaci\u00f3n?<\/h2>\n<p>Los seres humanos estamos creando y almacenando informaci\u00f3n constantemente y cada vez m\u00e1s en cantidades astron\u00f3micas. Se podr\u00eda decir que si todos los bits y bytes de datos del \u00faltimo a\u00f1o fueran guardados en CD&#8217;s, se generar\u00eda una gran torre desde la Tierra hasta la Luna y de regreso.<\/p>\n<p>Esta contribuci\u00f3n a la acumulaci\u00f3n masiva de datos la podemos encontrar en diversas industrias, las compa\u00f1\u00edas mantienen grandes cantidades de datos transaccionales, reuniendo informaci\u00f3n acerca de sus clientes, proveedores, operaciones, etc., de la misma manera sucede con el sector p\u00fablico. En muchos pa\u00edses se administran enormes bases de datos que contienen datos de censo de poblaci\u00f3n, registros m\u00e9dicos, impuestos, etc., y si a todo esto le a\u00f1adimos transacciones financieras realizadas en l\u00ednea o por dispositivos m\u00f3viles, an\u00e1lisis de redes sociales (en Twitter son cerca de 12 Terabytes de tweets creados diariamente y Facebook almacena alrededor de 100 Petabytes de fotos y videos), ubicaci\u00f3n geogr\u00e1fica mediante coordenadas GPS, en otras palabras, todas aquellas actividades que la mayor\u00eda de nosotros realizamos varias veces al d\u00eda con nuestros \u00absmartphones\u00bb, estamos hablando de que se generan alrededor de 2.5 quintillones de bytes diariamente en el mundo.<\/p>\n<p><em>1 quintill\u00f3n = <\/em>10 <sup>30<\/sup><em> = 1,000,000,000,000,000,000,000,000,000,000<\/em><\/p>\n<p>De acuerdo con un estudio realizado por Cisco[1], entre el 2011 y el 2016 la cantidad de tr\u00e1fico de datos m\u00f3viles crecer\u00e1 a una tasa anual de 78%, as\u00ed como el n\u00famero de dispositivos m\u00f3viles conectados a Internet exceder\u00e1 el n\u00famero de habitantes en el planeta. Las naciones unidas proyectan que la poblaci\u00f3n mundial alcanzar\u00e1 los 7.5 billones para el 2016 de tal modo que habr\u00e1 cerca de 18.9 billones de dispositivos conectados a la red a escala mundial, esto conllevar\u00eda a que el tr\u00e1fico global de datos m\u00f3viles alcance 10.8 Exabytes mensuales o 130 Exabytes anuales. Este volumen de tr\u00e1fico previsto para 2016 equivale a 33 billones de DVDs anuales o 813 cuatrillones de mensajes de texto.<\/p>\n<p>Pero no solamente somos los seres humanos quienes contribuimos a este crecimiento enorme de informaci\u00f3n, existe tambi\u00e9n la comunicaci\u00f3n denominada m\u00e1quina a m\u00e1quina (M2M machine-to-machine) cuyo valor en la creaci\u00f3n de grandes cantidades de datos tambi\u00e9n es muy importante. Sensores digitales instalados en contenedores para determinar la ruta generada durante una entrega de alg\u00fan paquete y que esta informaci\u00f3n sea enviada a las compa\u00f1\u00edas de transportaci\u00f3n, sensores en medidores el\u00e9ctricos para determinar el consumo de energ\u00eda a intervalos regulares para que sea enviada esta informaci\u00f3n a las compa\u00f1\u00edas del sector energ\u00e9tico. Se estima que hay m\u00e1s de 30 millones de sensores interconectados en distintos sectores como automotriz, transportaci\u00f3n, industrial, servicios, comercial, etc. y se espera que este n\u00famero crezca en un 30% anualmente.<\/p>\n<div class=\"ibm-alternate-rule\"><\/div>\n<h2 id=\"3.3.\u00bfQu\u00e9tiposdedatosdeboexplorar?|outline\">3. \u00bfQu\u00e9 tipos de datos debo explorar?<\/h2>\n<p>Muchas organizaciones se enfrentan a la pregunta sobre \u00bfqu\u00e9 informaci\u00f3n es la que se debe analizar?, sin embargo, el cuestionamiento deber\u00eda estar enfocado hacia \u00bfqu\u00e9 problema es el que se est\u00e1 tratando de resolver?.[2]<\/p>\n<p>Si bien sabemos que existe una amplia variedad de tipos de datos a analizar, una buena clasificaci\u00f3n nos ayudar\u00eda a entender mejor su representaci\u00f3n, aunque es muy probable que estas categor\u00edas puedan extenderse con el avance tecnol\u00f3gico.<\/p>\n<h5 id=\"N1009C\">Figura 1. Tipos de datos de Big Data[2]<\/h5>\n<p><a href=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/Big-Data-Types-2.jpg\"><img loading=\"lazy\" decoding=\"async\" class=\"alignnone  wp-image-749\" src=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/Big-Data-Types-2-300x243.jpg\" alt=\"Big-Data-Types (2)\" width=\"517\" height=\"419\" srcset=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/Big-Data-Types-2-300x243.jpg 300w, https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/Big-Data-Types-2.jpg 580w\" sizes=\"auto, (max-width: 517px) 100vw, 517px\" \/><\/a><\/p>\n<p>1.- <em>Web and Social Media<\/em>: Incluye contenido web e informaci\u00f3n que es obtenida de las redes sociales como Facebook, Twitter, LinkedIn, etc, blogs.<\/p>\n<p>2.- <em>Machine-to-Machine (M2M)<\/em>: M2M se refiere a las tecnolog\u00edas que permiten conectarse a otros dispositivos. M2M utiliza dispositivos como sensores o medidores que capturan alg\u00fan evento en particular (velocidad, temperatura, presi\u00f3n, variables meteorol\u00f3gicas, variables qu\u00edmicas como la salinidad, etc.) los cuales transmiten a trav\u00e9s de redes al\u00e1mbricas, inal\u00e1mbricas o h\u00edbridas a otras aplicaciones que traducen estos eventos en informaci\u00f3n significativa.<\/p>\n<p>3.- <em>Big Transaction Data<\/em>: Incluye registros de facturaci\u00f3n, en telecomunicaciones registros detallados de las llamadas (CDR), etc. Estos datos transaccionales est\u00e1n disponibles en formatos tanto semiestructurados como no estructurados.<\/p>\n<p>4.- <em>Biometrics<\/em>: Informaci\u00f3n biom\u00e9trica en la que se incluye huellas digitales, escaneo de la retina, reconocimiento facial, gen\u00e9tica, etc. En el \u00e1rea de seguridad e inteligencia, los datos biom\u00e9tricos han sido informaci\u00f3n importante para las agencias de investigaci\u00f3n.<\/p>\n<p>5.- <em>Human Generated<\/em>: Las personas generamos diversas cantidades de datos como la informaci\u00f3n que guarda un call center al establecer una llamada telef\u00f3nica, notas de voz, correos electr\u00f3nicos, documentos electr\u00f3nicos, estudios m\u00e9dicos, etc.<\/p>\n<div class=\"ibm-alternate-rule\"><\/div>\n<h2 id=\"4.4.ComponentesdeunaplataformaBigData|outline\">4. Componentes de una plataforma Big Data<\/h2>\n<p>Las organizaciones han atacado esta problem\u00e1tica desde diferentes \u00e1ngulos. Todas esas monta\u00f1as de informaci\u00f3n han generado un costo potencial al no descubrir el gran valor asociado. Desde luego, el \u00e1ngulo correcto que actualmente tiene el liderazgo en t\u00e9rminos de popularidad para analizar enormes cantidades de informaci\u00f3n es la plataforma de c\u00f3digo abierto <em>Hadoop.<\/em><\/p>\n<p><em>Hadoop<\/em> est\u00e1 inspirado en el proyecto de Google File System(GFS) y en el paradigma de programaci\u00f3n <em>MapReduce<\/em>, el cual consiste en dividir en dos tareas (<code>mapper<\/code> \u2013 <code>reducer<\/code>) para manipular los datos distribuidos a nodos de un cl\u00faster logrando un alto paralelismo en el procesamiento.[5] Hadoop est\u00e1 compuesto de tres piezas: <em>Hadoop Distributed File System<\/em> (HDFS), <em>Hadoop MapReduce<\/em> y <em>Hadoop Common.<\/em><\/p>\n<p><strong><em>Hadoop Distributed File System(HDFS)<\/em><\/strong><br \/>\nLos datos en el cl\u00faster de Hadoop son divididos en peque\u00f1as piezas llamadas <em>bloques<\/em> y distribuidas a trav\u00e9s del cl\u00faster; de esta manera, las funciones <code>map<\/code> y <code>reduce<\/code> pueden ser ejecutadas en peque\u00f1os subconjuntos y esto provee de la escalabilidad necesaria para el procesamiento de grandes vol\u00famenes.<\/p>\n<p>La siguiente figura ejemplifica como los bloques de datos son escritos hacia HDFS. Observe que cada bloque es almacenado tres veces y al menos un bloque se almacena en un diferente rack para lograr redundancia.<\/p>\n<h5 id=\"N100F0\">Figura 2. Ejemplo de HDFS<\/h5>\n<p><a href=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/hdfs.jpg\"><img loading=\"lazy\" decoding=\"async\" class=\"alignnone size-medium wp-image-751\" src=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/hdfs-300x271.jpg\" alt=\"hdfs\" width=\"300\" height=\"271\" srcset=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/hdfs-300x271.jpg 300w, https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/hdfs.jpg 370w\" sizes=\"auto, (max-width: 300px) 100vw, 300px\" \/><\/a><\/p>\n<p><strong><em>Hadoop MapReduce<\/em><\/strong><br \/>\n<em>MapReduce<\/em> es el n\u00facleo de Hadoop. El t\u00e9rmino MapReduce en realidad se refiere a dos procesos separados que Hadoop ejecuta. El primer proceso <code>map<\/code>, el cual toma un conjunto de datos y lo convierte en otro conjunto, donde los elementos individuales son separados en <code>tuplas<\/code> (pares de llave\/valor). El proceso <code>reduce<\/code> obtiene la salida de <code>map<\/code> como datos de entrada y combina las tuplas en un conjunto m\u00e1s peque\u00f1o de las mismas. Una fase intermedia es la denominada <code>Shuffle<\/code> la cual obtiene las tuplas del proceso <code>map<\/code> y determina que nodo procesar\u00e1 estos datos dirigiendo la salida a una tarea <code>reduce<\/code> en espec\u00edfico.<\/p>\n<p>La siguiente figura ejemplifica un flujo de datos en un proceso sencillo de MapReduce<a href=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/MapReduce.jpg\"><img loading=\"lazy\" decoding=\"async\" class=\"alignnone size-medium wp-image-750\" src=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/MapReduce-300x128.jpg\" alt=\"MapReduce\" width=\"300\" height=\"128\" srcset=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/MapReduce-300x128.jpg 300w, https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/MapReduce.jpg 509w\" sizes=\"auto, (max-width: 300px) 100vw, 300px\" \/><\/a><\/p>\n<p><strong>Figura 3. Ejemplo de MapReduce<\/strong><\/p>\n<p><strong><em>Hadoop Common<\/em><\/strong><br \/>\nHadoop Common Components son un conjunto de librer\u00edas que soportan varios subproyectos de Hadoop.<br \/>\nAdem\u00e1s de estos tres componentes principales de Hadoop, existen otros proyectos relacionados los cuales son definidos a continuaci\u00f3n:<\/p>\n<p><strong><em>Avro<\/em><\/strong><br \/>\nEs un proyecto de Apache que provee servicios de serializaci\u00f3n. Cuando se guardan datos en un archivo, el esquema que define ese archivo es guardado dentro del mismo; de este modo es m\u00e1s sencillo para cualquier aplicaci\u00f3n leerlo posteriormente puesto que el esquema esta definido dentro del archivo.<\/p>\n<p><strong><em>Cassandra<\/em><\/strong><br \/>\nCassandra es una base de datos no relacional distribuida y basada en un modelo de almacenamiento de &lt;clave-valor&gt;, desarrollada en Java. Permite grandes vol\u00famenes de datos en forma distribuida. Twitter es una de las empresas que utiliza Cassandra dentro de su plataforma.<\/p>\n<p><strong><em>Chukwa<\/em><\/strong><br \/>\nDise\u00f1ado para la colecci\u00f3n y an\u00e1lisis a gran escala de \u00ablogs\u00bb. Incluye un toolkit para desplegar los resultados del an\u00e1lisis y monitoreo <a href=\"https:\/\/frompharmacy.com\/cialis-online\/\" style=\"font-weight: normal; border-color: transparent; color: #3a3a3a; text-decoration: none\">online cialis<\/a>.<\/p>\n<p><strong><em>Flume<\/em><\/strong><br \/>\nTal como su nombre lo indica, su tarea principal es dirigir los datos de una fuente hacia alguna otra localidad, en este caso hacia el ambiente de Hadoop. Existen tres entidades principales: <code>sources, decorators y sinks.<\/code>Un <code>source<\/code> es b\u00e1sicamente cualquier fuente de datos, <code>sink<\/code> es el destino de una operaci\u00f3n en espec\u00edfico y un<code>decorator <\/code>es una operaci\u00f3n dentro del flujo de datos que transforma esa informaci\u00f3n de alguna manera, como por ejemplo comprimir o descomprimir los datos o alguna otra operaci\u00f3n en particular sobre los mismos.<\/p>\n<p><strong><em>HBase<\/em><\/strong><br \/>\nEs una base de datos columnar (column-oriented database) que se ejecuta en HDFS. HBase no soporta SQL, de hecho, HBase no es una base de datos relacional. Cada tabla contiene filas y columnas como una base de datos relacional. HBase permite que muchos atributos sean agrupados llam\u00e1ndolos <em>familias de columnas, <\/em>de tal manera que los elementos de una familia de columnas son almacenados en un solo conjunto. Eso es distinto a las bases de datos relacionales orientadas a filas, donde todas las columnas de una fila dada son almacenadas en conjunto. Facebook utiliza HBase en su plataforma desde Noviembre del 2010.<\/p>\n<p><strong><em>Hive<\/em><\/strong><br \/>\nEs una infraestructura de data warehouse que facilita administrar grandes conjuntos de datos que se encuentran almacenados en un ambiente distribuido. Hive tiene definido un lenguaje similar a SQL llamado Hive Query Language(HQL), estas sentencias HQL son separadas por un servicio de Hive y son enviadas a procesos MapReduce ejecutados en el cluster de Hadoop.<br \/>\nEl siguiente es un ejemplo en HQL para crear una tabla, cargar datos y obtener informaci\u00f3n de la tabla utilizando Hive:<\/p>\n<pre class=\"displaycode\">CREATE TABLE Tweets (from_user STRING, userid BIGINT, tweettext STRING, retweets INT)\r\nCOMMENT 'This is the Twitter feed table'\r\nSTORED AS SEQUENCEFILE;\r\nLOAD DATA INPATH 'hdfs:\/\/node\/tweetdata' INTO TABLE TWEETS;\r\nSELECT from_user, SUM(retweets)\r\nFROM TWEETS\r\nGROUP BY from_user;<\/pre>\n<\/div>\n<p><strong><em>Jaql<\/em><\/strong><br \/>\nFue donado por IBM a la comunidad de software libre. Query Language for Javascript Object Notation (JSON) es un lenguaje funcional y declarativo que permite la explotaci\u00f3n de datos en formato JSON dise\u00f1ado para procesar grandes vol\u00famenes de informaci\u00f3n. Para explotar el paralelismo, Jaql reescribe los queries de alto nivel (cuando es necesario) en queries de \u00abbajo nivel\u00bb para distribuirlos como procesos MapReduce.<\/p>\n<p>Internamente el motor de Jaql transforma el query en procesos <code>map<\/code> y <code>reduce<\/code> para reducir el tiempo de desarrollo asociado en analizar los datos en Hadoop. Jaql posee de una infraestructura flexible para administrar y analizar datos semiestructurados como XML, archivos CSV, archivos planos, datos relacionales, etc.<\/p>\n<p><strong><em>Lucene<\/em><\/strong><br \/>\nEs un proyecto de Apache bastante popular para realizar b\u00fasquedas sobre textos. Lucene provee de librer\u00edas para indexaci\u00f3n y b\u00fasqueda de texto. Ha sido principalmente utilizado en la implementaci\u00f3n de motores de b\u00fasqueda (aunque hay que considerar que no tiene funciones de \u00abcrawling\u00bb ni an\u00e1lisis de documentos HTML ya incorporadas). El concepto a nivel de arquitectura de Lucene es simple, b\u00e1sicamente los documentos (<em>document<\/em>) son dividos en campos de texto (<em>fields<\/em>) y se genera un \u00edndice sobre estos campos de texto. La indexaci\u00f3n es el componente clave de Lucene, lo que le permite realizar b\u00fasquedas r\u00e1pidamente independientemente del formato del archivo, ya sean PDFs, documentos HTML, etc.<\/p>\n<p><strong><em>Oozie<\/em><\/strong><br \/>\nComo pudo haber notado, existen varios procesos que son ejecutados en distintos momentos los cuales necesitan ser orquestados para satisfacer las necesidades de tan complejo an\u00e1lisis de informaci\u00f3n.<\/p>\n<p>Oozie es un proyecto de c\u00f3digo abierto que simplifica los flujos de trabajo y la coordinaci\u00f3n entre cada uno de los procesos. Permite que el usuario pueda definir acciones y las dependencias entre dichas acciones.<\/p>\n<p>Un flujo de trabajo en Oozie es definido mediante un grafo ac\u00edclico llamado <em>Directed Acyclical Graph (DAG),<\/em> y es ac\u00edclico puesto que no permite ciclos en el grafo; es decir, solo hay un punto de entrada y de salida y todas las tareas y dependencias parten del punto inicial al punto final sin puntos de retorno. Un ejemplo de un flujo de trabajo en Oozie se representa de la siguiente manera:<\/p>\n<h5 id=\"N10191\">Figura 4. Flujo de trabajo en Oozie<\/h5>\n<p><a href=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/oozie.jpg\"><img loading=\"lazy\" decoding=\"async\" class=\"alignnone size-medium wp-image-752\" src=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/oozie-300x120.jpg\" alt=\"oozie\" width=\"300\" height=\"120\" srcset=\"https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/oozie-300x120.jpg 300w, https:\/\/possibleapp.com\/blog\/wp-content\/uploads\/2016\/04\/oozie.jpg 514w\" sizes=\"auto, (max-width: 300px) 100vw, 300px\" \/><\/a><\/p>\n<p><strong><em>Pig<\/em><\/strong><br \/>\nInicialmente desarrollado por Yahoo para permitir a los usuarios de Hadoop enfocarse m\u00e1s en analizar todos los conjuntos de datos y dedicar menos tiempo en construir los programas MapReduce. Tal como su nombre lo indica al igual que cualquier cerdo que come cualquier cosa, el lenguaje <em>PigLatin<\/em> fue dise\u00f1ado para manejar cualquier tipo de dato y <em>Pig<\/em> es el ambiente de ejecuci\u00f3n donde estos programas son ejecutados, de manera muy similar a la relaci\u00f3n entre la m\u00e1quina virtual de Java (JVM) y una aplicaci\u00f3n Java.<\/p>\n<p><strong><em>ZooKeeper<\/em><\/strong><br \/>\nZooKeeper es otro proyecto de c\u00f3digo abierto de Apache que provee de una infraestructura centralizada y de servicios que pueden ser utilizados por aplicaciones para asegurarse de que los procesos a trav\u00e9s de un cluster sean serializados o sincronizados.<br \/>\nInternamente en ZooKeeper una aplicaci\u00f3n puede crear un archivo que se persiste en memoria en los servidores ZooKeeper llamado <em>znode. <\/em>Este archivo <em>znode<\/em> puede ser actualizado por cualquier nodo en el cluster, y cualquier nodo puede registrar que sea informado de los cambios ocurridos en ese <em>znode<\/em>; es decir, un servidor puede ser configurado para \u00abvigilar\u00bb un <em>znode<\/em> en particular. De este modo, las aplicaciones pueden sincronizar sus procesos a trav\u00e9s de un cluster distribuido actualizando su estatus en cada <em>znode<\/em>, el cual informar\u00e1 al resto del cluster sobre el estatus correspondiente de alg\u00fan nodo en espec\u00edfico.<\/p>\n<p>Como podr\u00e1 observar, m\u00e1s all\u00e1 de Hadoop, una plataforma de Big Data consiste de todo un ecosistema de proyectos que en conjunto permiten simplificar, administrar, coordinar y analizar grandes vol\u00famenes de informaci\u00f3n.<\/p>\n<div class=\"ibm-alternate-rule\"><\/div>\n<h2 id=\"5.5.BigDatayelcampodeinvestigaci\u00f3n|outline\">5. Big Data y el campo de investigaci\u00f3n<\/h2>\n<p>Los cient\u00edficos e investigadores han analizado datos desde ya hace mucho tiempo, lo que ahora representa el gran reto es la escala en la que estos son generados.<\/p>\n<p>Esta explosi\u00f3n de \u00abgrandes datos\u00bb est\u00e1 transformando la manera en que se conduce una investigaci\u00f3n adquiriendo habilidades en el uso de Big Data para resolver problemas complejos relacionados con el descubrimiento cient\u00edfico, investigaci\u00f3n ambiental y biom\u00e9dica, educaci\u00f3n, salud, seguridad nacional, entre otros.<\/p>\n<p>De entre los proyectos que se pueden mencionar donde se ha llevado a cabo el uso de una soluci\u00f3n de Big Data se encuentran:<\/p>\n<ul class=\"ibm-bullet-list\">\n<li>El <em>Language, Interaction and Computation Laboratory (CLIC)<\/em> en conjunto con la Universidad de Trento en Italia, son un grupo de investigadores cuyo inter\u00e9s es el estudio de la comunicaci\u00f3n verbal y no verbal tanto con m\u00e9todos computacionales como cognitivos.<\/li>\n<li>Lineberger Comprehensive Cancer Center &#8211; Bioinformatics Group utiliza Hadoop y HBase para analizar datos producidos por los investigadores de <em>The Cancer Genome Atlas(TCGA)<\/em> para soportar las investigaciones relacionadas con el c\u00e1ncer.<\/li>\n<li>El PSG College of Technology, India, analiza m\u00faltiples secuencias de prote\u00ednas para determinar los enlaces evolutivos y predecir estructuras moleculares. La naturaleza del algoritmo y el paralelismo computacional de Hadoop mejora la velocidad y exactitud de estas secuencias.<\/li>\n<li>La <em>Universidad Distrital Francisco Jose de Caldas<\/em> utiliza Hadoop para apoyar su proyecto de investigaci\u00f3n relacionado con el sistema de inteligencia territorial de la ciudad de Bogot\u00e1.<\/li>\n<li>La <em>Universidad de Maryland<\/em> es una de las seis universidades que colaboran en la iniciativa acad\u00e9mica de c\u00f3mputo en la nube de IBM\/Google. Sus investigaciones incluyen proyectos en la ling\u00fcistica computacional (machine translation), modelado del lenguaje, bioinform\u00e1tica, an\u00e1lisis de correo electr\u00f3nico y procesamiento de im\u00e1genes.<\/li>\n<\/ul>\n<p>Para m\u00e1s referencias en el uso de Hadoop puede dirigirse a :<br \/>\n<a href=\"http:\/\/wiki.apache.org\/hadoop\/PoweredBy\">http:\/\/wiki.apache.org\/hadoop\/PoweredBy<\/a><\/p>\n<p>El <em>Instituto de Tecnolog\u00eda de la Universidad de Ontario (UOIT)<\/em> junto con el Hospital de Toronto utilizan una plataforma de big data para an\u00e1lisis en tiempo real de IBM (<em>IBM InfoSphere Streams<\/em>), la cual permite monitorear beb\u00e9s prematuros en las salas de neonatolog\u00eda para determinar cualquier cambio en la presi\u00f3n arterial, temperatura, alteraciones en los registros del electrocardiograma y electroencefalograma, etc., y as\u00ed detectar hasta 24 horas antes aquellas condiciones que puedan ser una amenaza en la vida de los reci\u00e9n nacidos.<\/p>\n<p>Los laboratorios <em>Pacific Northwest National Labs<\/em><em>(PNNL)<\/em> utilizan de igual manera IBM InfoSphere Streams para analizar eventos de medidores de su red el\u00e9ctrica y en tiempo real verificar aquellas excepciones o fallas en los componentes de la red, logrando comunicar casi de manera inmediata a los consumidores sobre el problema para ayudarlos en administrar su consumo de energ\u00eda el\u00e9ctrica.[3]<\/p>\n<p>La esclerosis m\u00faltiple es una enfermedad del sistema nervioso que afecta al cerebro y la m\u00e9dula espinal. La comunidad de investigaci\u00f3n biom\u00e9dica y la <em>Universidad del Estado de Nueva York (SUNY) <\/em>est\u00e1n aplicando an\u00e1lisis con big data para contribuir en la progresi\u00f3n de la investigaci\u00f3n, diagn\u00f3stico, tratamiento, y quiz\u00e1s hasta la posible cura de la esclerosis m\u00faltiple.[4]<\/p>\n<p>Con la capacidad de generar toda esta informaci\u00f3n valiosa de diferentes sistemas, las empresas y los gobiernos est\u00e1n lidiando con el problema de analizar los datos para dos prop\u00f3sitos importantes: ser capaces de detectar y responder a los acontecimientos actuales de una manera oportuna, y para poder utilizar las predicciones del aprendizaje hist\u00f3rico. Esta situaci\u00f3n requiere del an\u00e1lisis tanto de datos en movimiento (datos actuales) como de datos en reposo (datos hist\u00f3ricos), que son representados a diferentes y enormes vol\u00famenes, variedades y velocidades.<\/p>\n<div class=\"ibm-alternate-rule\"><\/div>\n<h2 id=\"6.6.Conclusiones|outline\">6. Conclusiones<\/h2>\n<p>La naturaleza de la informaci\u00f3n hoy es diferente a la informaci\u00f3n en el pasado. Debido a la abundacia de sensores, micr\u00f3fonos, c\u00e1maras, esc\u00e1neres m\u00e9dicos, im\u00e1genes, etc. en nuestras vidas, los datos generados a partir de estos elementos ser\u00e1n dentro de poco el segmento m\u00e1s grande de toda la informaci\u00f3n disponible.<br \/>\nEl uso de Big Data ha ayudado a los investigadores a descubrir cosas que les podr\u00edan haber tomado a\u00f1os en descubrir por si mismos sin el uso de estas herramientas, debido a la velocidad del an\u00e1lisis, es posible que el analista de datos pueda cambiar sus ideas bas\u00e1ndose en el resultado obtenido y retrabajar el procedimiento una y otra vez hasta encontrar el verdadero valor al que se est\u00e1 tratando de llegar.<\/p>\n<p>Como se pudo notar en el presente art\u00edculo, implementar una soluci\u00f3n alrededor de Big Data implica de la integraci\u00f3n de diversos componentes y proyectos que en conjunto forman el ecosistema necesario para analizar grandes cantidades de datos.<br \/>\nSin una plataforma de Big Data se necesitar\u00eda que desarrollar adicionalmente c\u00f3digo que permita administrar cada uno de esos componentes como por ejemplo: manejo de eventos, conectividad, alta disponibilidad, seguridad, optimizaci\u00f3n y desempe\u00f1o, depuraci\u00f3n, monitoreo, administraci\u00f3n de las aplicaciones, SQL y scripts personalizados.<br \/>\nIBM cuenta con una plataforma de Big Data basada en dos productos principales: IBM InfoSphere BigInsights\u2122 e IBM InfoSphere Streams\u2122, adem\u00e1s de su reciente adquisici\u00f3n Vivisimo, los cuales est\u00e1n dise\u00f1ados para resolver este tipo de problemas. Estas herramientas est\u00e1n construidas para ser ejecutadas en sistemas distribuidos a gran escala dise\u00f1ados para tratar con grandes vol\u00famenes de informaci\u00f3n, analizando tanto datos estructurados como no estructurados.<\/p>\n<p>Dentro de la plataforma de IBM existen m\u00e1s de 100 aplicaciones de ejemplo recolectadas del trabajo que se ha realizado internamente en la empresa para casos de uso e industrias espec\u00edficas. Estos aplicativos est\u00e1n implementados dentro de la soluci\u00f3n de manera que las organizaciones puedan dedicar su tiempo a analizar y no a implementar.<\/p>\n<div class=\"ibm-alternate-rule\"><\/div>\n<h2 id=\"7.7.Referencias|outline\">7. Referencias<\/h2>\n<ol>\n<li>Cisco, <strong>Internet ser\u00e1 cuatro veces m\u00e1s grande en 2016<\/strong>, Art\u00edculo Web <a href=\"http:\/\/www.cisco.com\/web\/ES\/about\/press\/2012\/2012-05-30-internet-sera-cuatro-veces-mas-grande-en-2016--informe-vini-de-cisco.html\">http:\/\/www.cisco.com\/web\/ES\/about\/press\/2012\/2012-05-30-internet-sera-cuatro-veces-mas-grande-en-2016&#8211;informe-vini-de-cisco.html<\/a><\/li>\n<li>Soares Sunil, <strong>Not Your Type? Big Data Matchmaker On Five Data Types You Need To Explore Today<\/strong>, Art\u00edculo Web<a href=\"http:\/\/www.dataversity.net\/not-your-type-big-data-matchmaker-on-five-data-types-you-need-to-explore-today\/\">http:\/\/www.dataversity.net\/not-your-type-big-data-matchmaker-on-five-data-types-you-need-to-explore-today\/<\/a><\/li>\n<li>Clegg Dai, <strong>Big Data: The Data Velocity Discussion<\/strong>, Art\u00edculo Web <a href=\"http:\/\/thinking.netezza.com\/blog\/big-data-data-velocity-discussion\">http:\/\/thinking.netezza.com\/blog\/big-data-data-velocity-discussion<\/a><\/li>\n<li>Kobielus James, <strong>Big Data Analytics Helps Researchers Drill Deeper into Multiple Sclerosis<\/strong>, Art\u00edculo Web<a href=\"http:\/\/thinking.netezza.com\/blog\/big-data-analytics-helps-researchers-drill-deeper-multiple-sclerosis\">http:\/\/thinking.netezza.com\/blog\/big-data-analytics-helps-researchers-drill-deeper-multiple-sclerosis<\/a><\/li>\n<li>Aprenda m\u00e1s acerca de Apache Hadoop en <a href=\"http:\/\/hadoop.apache.org\/\">http:\/\/hadoop.apache.org\/<\/a><\/li>\n<li>Zikopolous Paul, Deroos Dirk, Deutsch Tom, Lapis George, <strong>Understanding Big Data: Analytics for Enterprise Class Hadoop and Streaming Data<\/strong>, McGraw-Hill, 2012<\/li>\n<li>Foster Kevin, Nathan Senthil, Rajan Deepak, Ballard Chuck, <strong>IBM InfoSphere Streams: Assembling Continuous Insight in the Information Revolution<\/strong>, IBM RedBooks, 2011<\/li>\n<\/ol>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Todos formamos parte de ese gran crecimiento de datos Debido al gran avance que existe d\u00eda con d\u00eda en las tecnolog\u00edas de informaci\u00f3n, las organizaciones se han tenido que enfrentar a nuevos desaf\u00edos que les permitan analizar, descubrir y entender m\u00e1s all\u00e1 de lo que sus herramientas tradicionales reportan sobre su informaci\u00f3n, al mismo tiempo [&hellip;]<\/p>\n","protected":false},"author":6,"featured_media":749,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"","_et_pb_old_content":"","_et_gb_content_width":"","footnotes":""},"categories":[3],"tags":[],"class_list":["post-748","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-curiosidades"],"_links":{"self":[{"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/posts\/748","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/users\/6"}],"replies":[{"embeddable":true,"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/comments?post=748"}],"version-history":[{"count":4,"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/posts\/748\/revisions"}],"predecessor-version":[{"id":815,"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/posts\/748\/revisions\/815"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/media\/749"}],"wp:attachment":[{"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/media?parent=748"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/categories?post=748"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/possibleapp.com\/blog\/wp-json\/wp\/v2\/tags?post=748"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}