{"id":9208,"date":"2019-01-04T08:02:16","date_gmt":"2019-01-04T07:02:16","guid":{"rendered":"https:\/\/www.makingscience.com\/blog\/extraccion-de-datos-con-screaming-frog\/"},"modified":"2019-01-04T08:02:16","modified_gmt":"2019-01-04T07:02:16","slug":"extraccion-de-datos-con-screaming-frog","status":"publish","type":"post","link":"https:\/\/www.makingscience.com\/es\/blog\/extraccion-de-datos-con-screaming-frog\/","title":{"rendered":"Extracci\u00f3n de datos con Screaming Frog"},"content":{"rendered":"<div>Extracci\u00f3n de datos con Screaming Frog<\/div>\n<div>Hace unos meses, mi compa\u00f1era de SEO Olivia Jim\u00e9nez escribi\u00f3 un art\u00edculo de <a href=\"https:\/\/www.makingscience.com\/introduccion-a-las-expresiones-regulares-en-seo\/\" target=\"_blank\" rel=\"noopener\">expresiones regulares \u00fatiles para SEO<\/a>, entre las que se encontraban algunas de Screaming Frog para la extracci\u00f3n de informaci\u00f3n. En el post de hoy, profundizaremos un poco m\u00e1s sobre esta herramienta y conoceremos algunas de sus funciones m\u00e1s avanzadas para extraer datos de nuestras web (custom extraction).  <img fetchpriority=\"high\" decoding=\"async\" class=\"alignnone wp-image-1772\" src=\"\/wp-content\/uploads_old\/2019\/01\/1-1.png\" alt=\"\" width=\"621\" height=\"291\" \/>  Lo primero que tenemos que saber es que desde Screaming Frog se facilitan tres m\u00e9todos de extracci\u00f3n: <\/p>\n<ul>\n<li><strong>CSSPath<\/strong>: permite consultar y seleccionar los selectores de ruta CSS.<\/li>\n<li><strong>XPath<\/strong>: permite consultar y seleccionar elementos HTML, incluidos los atributos.<\/li>\n<li><strong>Regex<\/strong>: expresiones regulares avanzadas para extraer html y JavaScript en l\u00ednea.<\/li>\n<\/ul>\n<p> <img decoding=\"async\" class=\"size-full wp-image-1773 aligncenter\" src=\"\/wp-content\/uploads_old\/2019\/01\/2-1.png\" alt=\"\" width=\"271\" height=\"161\" \/>  De los tres selectores, lo m\u00e1s comunes y usados son los dos primeros, depende de cada uno, la elecci\u00f3n de uno u otro. Independientemente de la elecci\u00f3n, una vez seleccionado te permiten una serie de opciones: <\/p>\n<ul>\n<li><strong>Extraer HTML interno:<\/strong> el contenido HTML interno del elemento seleccionado. Si el elemento seleccionado contiene otros elementos HTML, se incluir\u00e1n.<\/li>\n<li><strong>Extraer elemento HTML:<\/strong> el elemento seleccionado y todo su contenido HTML interno.<\/li>\n<li><strong>Extraer texto:<\/strong> extrae el texto del elemento seleccionado.<\/li>\n<\/ul>\n<p> <img decoding=\"async\" class=\"size-full wp-image-1774 aligncenter\" src=\"\/wp-content\/uploads_old\/2019\/01\/3-1.png\" alt=\"\" width=\"180\" height=\"121\" \/>  A continuaci\u00f3n, vamos a ver algunos ejemplos de que permiten cada una de las tres opciones principales de extracci\u00f3n:  <strong>XPath<\/strong>  Screaming Frog por defecto te permite extraer a nivel headings los H1 y H2, sin embargo, \u00bfqu\u00e9 pasa si necesitamos extraer los H3, H4, etc? Pues tan sencillo como incluir:  \/\/h3  Posteriormente, filtramos por texto y nos sacar\u00e1 el texto de todos los elementos con esta etiqueta.  Si realizamos la prueba sobre nuestro blog, podemos ver un ejemplo de ello:  <img loading=\"lazy\" decoding=\"async\" class=\"alignnone wp-image-1775\" src=\"\/wp-content\/uploads_old\/2019\/01\/4-1.png\" alt=\"\" width=\"634\" height=\"118\" \/>  Como vemos, de la url de la home, ha detectado y extra\u00eddo siete elementos H3, pero, y si solo queremos extraer el primer elemento h3 de nuestra web? La f\u00f3rmula a incluir ser\u00e1 la siguiente f\u00f3rmula:  \/descendant::h3[1]  Si queremos recopilar un n\u00famero en concreto de H3 de una p\u00e1gina, por ejemplo cinco, la f\u00f3rmula ser\u00eda:  \/descendant::h3[position() &gt;= 0 and position() &lt;= 5]  Por \u00faltimo, a destacar dentro de las m\u00faltiples opciones de extracci\u00f3n dentro de este m\u00e9todo quiero destacar dos. Por un lado, la extracci\u00f3n de urls AMP, cuya f\u00f3rmula ser\u00eda:  \/\/head\/link[@rel=&#8217;amphtml&#8217;]\/@href  Y por otro lado, extraer Hreflang, cuyo filtro deber\u00e1 pasar a extraer elemento html y su f\u00f3rmula ser\u00eda:  \/\/*[@hreflang]  <strong>CSSPath<\/strong>  Es una de las f\u00f3rmulas m\u00e1s sencillas ya que tan solo tendr\u00e1s que copiar el selector correspondiente del elemento que quieras extraer. Por ejemplo, si queremos extraer el primer p\u00e1rrafo de todos los art\u00edculos de nuestro blog, tan sencillo como abrir el inspector, seleccionar el elemento y pegarlo en Screaming Frog:  <img loading=\"lazy\" decoding=\"async\" class=\"alignnone size-full wp-image-1776\" src=\"\/wp-content\/uploads_old\/2019\/01\/5-1.png\" alt=\"\" width=\"439\" height=\"334\" \/>  <strong>Regex<\/strong>  Una de las opciones m\u00e1s interesantes que ofrece este extractor sobre el que se puede hacer un uso m\u00e1s habitual en SEO, es para extraer todos los datos estructurados implementados a trav\u00e9s de J-SON. La f\u00f3rmula ser\u00eda la siguiente:  &lt;script type=\\\u00bbapplication\\\/ld\\+json\\\u00bb&gt;(.*?)&lt;\/script&gt;  Estas son algunas de las opciones que te ofrece Screaming Frog a la hora de extraer datos, sin embargo las combinaciones dentro de ella son infinitas. Ahora tan solo queda llevarlas a la pr\u00e1ctica y automatizar tareas que de otra forma conllevar\u00edan mucho tiempo.<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Extracci\u00f3n de datos con Screaming Frog Hace unos meses, mi compa\u00f1era de SEO Olivia Jim\u00e9nez escribi\u00f3 un art\u00edculo de expresiones regulares \u00fatiles para SEO, entre las que se encontraban algunas de Screaming Frog para la extracci\u00f3n de informaci\u00f3n. En el post de hoy, profundizaremos un poco m\u00e1s sobre esta herramienta y conoceremos algunas de sus [&hellip;]<\/p>\n","protected":false},"author":21,"featured_media":9209,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":""},"categories":[27],"tags":[37],"class_list":["post-9208","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-advertising","tag-seo"],"acf":[],"_links":{"self":[{"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/posts\/9208","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/users\/21"}],"replies":[{"embeddable":true,"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/comments?post=9208"}],"version-history":[{"count":0,"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/posts\/9208\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/media\/9209"}],"wp:attachment":[{"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/media?parent=9208"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/categories?post=9208"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.makingscience.com\/es\/wp-json\/wp\/v2\/tags?post=9208"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}