Algoritmos y técnicas para comprimir datos genómicos, a debate en el Desayuno TIC Talk de mayo
El Desayuno TIC Talk, celebrado el pasado martes 26 de mayo, contó con la participación de Rodrigo Blanco Amoedo, que ofreció la conferencia titulada «Comprimiendo el genoma: algoritmos, técnicas y archivos biológicos», centrada en los métodos actuales para el almacenamiento y compresión eficiente de datos genómicos.
Durante la sesión, el ponente introdujo la estructura de los ficheros FASTQ, el formato más empleado para guardar fragmentos del genoma de un organismo. Aunque no existe un estándar unificado, estos archivos son una solución de referencia en el campo de la biología computacional, debido al volumen de datos que generan las tecnologías de secuenciación masiva y a la necesidad de manejar esta información con la mayor eficiencia posible.
Blanco Amoedo presentó la evolución de las herramientas de compresión a lo largo del tiempo, explicando desde las soluciones genéricas, como GZip o WinRAR, altamente valoradas por su facilidad de uso, hasta algoritmos especializados desarrollados específicamente para datos genómicos.
Entre estos últimos destacan herramientas como FaStore, Spring y FQSqueezer, que aprovechan la alta repetitividad característica de los datos presentes en este tipo de ficheros, logrando una mayor tasa de compresión. Blanco Amoedo también mencionó otro tipo de soluciones punteras, como GeneSqueeze, y otras alternativas comerciales.
Presentó las ventajas e inconvenientes de cada una de estas soluciones. Como conclusión, realizó un balance del estado actual de las tecnologías de compresión genómica y apuntó hacia una posible línea de trabajo: una aproximación al problema mediante estructuras de datos compactas.