> ## Documentation Index
> Fetch the complete documentation index at: https://help.ciarem.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Fuentes de sitio web: indexa todo tu sitio

> Cómo Ciarem encuentra las páginas de un sitio web, cómo eliges cuáles indexar y cómo las mantiene al día con un rastreo semanal.

Una fuente de sitio web es tu sitio completo, no una sola página. Tú agregas la dirección. Ciarem encuentra las páginas que hay detrás. Tú eliges de qué páginas deben aprender tus agentes. Cada semana, Ciarem revisa si esas páginas cambiaron y te avisa cuando el sitio tiene páginas nuevas.

## Cómo encuentra Ciarem tus páginas

La búsqueda ocurre mientras esperas en el diálogo. Tarda unos diez segundos como máximo. Ciarem prueba primero la fuente más completa:

1. **Tu sitemap.** Ciarem lee `robots.txt` para encontrar el sitemap que declara y luego prueba `/sitemap.xml` y `/wp-sitemap.xml`. La mayoría de los sitios (WordPress, Webflow, Shopify, Next.js y otros) listan ahí todas sus páginas públicas, así que este es el resultado habitual.
2. **Los enlaces de tus páginas.** Si no hay sitemap, Ciarem lee los enlaces de la dirección que escribiste. Después lee los enlaces de las páginas a las que apunta esa dirección. Solo sigue enlaces del mismo sitio.
3. **Páginas comunes.** Ciarem también revisa direcciones que casi todos los sitios tienen, como `/about`, `/pricing`, `/faq`, `/contact`, `/blog`, `/terms` y `/privacy`. Conserva las que existen de verdad.
4. **La dirección que escribiste.** Si no aparece nada más, Ciarem indexa esa página por sí sola.

Ten en cuenta:

* `www.ejemplo.com` y `ejemplo.com` cuentan como el mismo sitio. Si la dirección que escribiste no responde, Ciarem prueba la otra.
* Ciarem lista hasta **100 páginas** por sitio. Omite las páginas de carrito, pago e inicio de sesión, las áreas de administración y los archivos, como PDF e imágenes. Para indexar un PDF, agrégalo como [fuente de archivo](/es/ai-agent/knowledge-bases).
* Las versiones en otros idiomas de una página (por ejemplo `/es/` y `/pt/`) también se listan. Tú decides cuáles conservar.

## Agregar un sitio web

<Steps>
  <Step title="Abre una base de conocimiento">
    Haz clic en **Agregar información** y luego en **Sitio web**.
  </Step>

  <Step title="Ponle nombre a la fuente y escribe la dirección">
    Ponle un nombre a la fuente y escribe la dirección del sitio.

    <img src="https://mintcdn.com/ciaremaai/dAYM1i_8tIIG0EQ3/images/es/ciarem-help-website-dialog.png?fit=max&auto=format&n=dAYM1i_8tIIG0EQ3&q=85&s=0b7175cf5baddc36857cc940314c1406" alt="El diálogo de sitio web: un nombre, la dirección del sitio y el botón Buscar páginas" width="1680" height="1114" data-path="images/es/ciarem-help-website-dialog.png" />
  </Step>

  <Step title="Haz clic en Buscar páginas">
    Las páginas aparecen agrupadas como carpetas. Primero va la dirección que escribiste, luego grupos como `blog`, `es` o `pt` y después las páginas sueltas. Todas las páginas empiezan seleccionadas.

    <img src="https://mintcdn.com/ciaremaai/dAYM1i_8tIIG0EQ3/images/es/ciarem-help-website-pages.png?fit=max&auto=format&n=dAYM1i_8tIIG0EQ3&q=85&s=dba9d45bf3929363df2a45c83a4bebec" alt="Las páginas que Ciarem encontró en ciarem.ai, agrupadas por sección, todas seleccionadas" width="1680" height="1114" data-path="images/es/ciarem-help-website-pages.png" />
  </Step>

  <Step title="Elige las páginas a indexar">
    * La casilla de un grupo selecciona o quita todas las páginas que contiene. Un clic cubre todo el blog, o solo sus artículos en portugués. La casilla muestra un guion cuando solo algunas páginas del grupo están seleccionadas.
    * Haz clic en la flecha junto a un grupo para abrirlo y elegir páginas individuales.
    * Usa el filtro para encontrar una página por nombre o dirección.

          <img src="https://mintcdn.com/ciaremaai/dAYM1i_8tIIG0EQ3/images/es/ciarem-help-website-pages-groups.png?fit=max&auto=format&n=dAYM1i_8tIIG0EQ3&q=85&s=49ca5f34fd9b371d686a4510c687e231" alt="El grupo blog abierto, con sus artículos en portugués sin seleccionar y la casilla del grupo mostrando una selección parcial" width="1680" height="1114" data-path="images/es/ciarem-help-website-pages-groups.png" />
  </Step>

  <Step title="Haz clic en Agregar N páginas">
    El contador muestra cuántas páginas vas a agregar. Haz clic en **Agregar N páginas** para terminar.
  </Step>
</Steps>

<Tip>
  Quita las páginas de las que tu agente no debería aprender, como archivos del blog, páginas de etiquetas o idiomas que no atiendes. Un conjunto pequeño de buenas páginas da mejores respuestas que el sitio completo.
</Tip>

## Qué pasa después de agregarlo

Ciarem descarga e indexa cada página por separado. La tarjeta de la fuente muestra el número de páginas y de fragmentos. Para ver cada página con su estado, abre **⋯ → Ver páginas**:

* **Indexada**: la página ya forma parte de la base de conocimiento.
* **Indexando**: la página todavía se está procesando.
* **Falló**: la página no se pudo indexar. La lista muestra el motivo. Por ejemplo: no se pudo acceder a la página, el sitio respondió con un error, la página no es HTML, no tiene texto legible, necesita JavaScript para mostrar su contenido o el sitio bloqueó la solicitud.

<img src="https://mintcdn.com/ciaremaai/dAYM1i_8tIIG0EQ3/images/es/ciarem-help-website-page-status.png?fit=max&auto=format&n=dAYM1i_8tIIG0EQ3&q=85&s=226c5e648eb568f8e95e008fb9d4017e" alt="La lista de páginas de una fuente de sitio web: cada página con su título, dirección, estado y número de fragmentos" width="1680" height="1114" data-path="images/es/ciarem-help-website-page-status.png" />

Que fallen unas pocas páginas no hace fallar toda la fuente. La fuente sigue lista y la tarjeta te dice cuántas páginas fallaron, para que decidas si importan.

Ciarem deja fuera el texto que se repite en todas las páginas, como menús, pies de página y avisos de cookies. Los sitios hechos con JavaScript también funcionan. Cuando el contenido de una página solo aparece al ejecutar JavaScript, Ciarem renderiza la página antes de indexarla.

## Mantenerlo al día: el rastreo semanal

Una vez por semana, Ciarem vuelve a visitar todas las páginas de la fuente:

* **Las páginas que no cambiaron** se quedan como están. Ciarem compara el texto de la página con la versión que indexó, así que solo vuelve a indexar una página cuando el contenido cambió de verdad.
* **Las páginas que cambiaron** se vuelven a indexar una por una. Las demás páginas no se tocan.
* **Las páginas que fallan** conservan el contenido que tenían. Quedan marcadas como fallidas en la lista de páginas. Una caída temporal nunca elimina respuestas que tu agente ya da.

Las páginas nuevas del sitio **no se agregan automáticamente**. La tarjeta te dice cuántas páginas nuevas encontró Ciarem. Haz clic en **Revisar** para verlas.

<img src="https://mintcdn.com/ciaremaai/dAYM1i_8tIIG0EQ3/images/es/ciarem-help-website-card.png?fit=max&auto=format&n=dAYM1i_8tIIG0EQ3&q=85&s=ae4412a3da70d34ed990f405c7df12ec" alt="Una fuente de sitio web después de un rastreo: la tarjeta muestra cuántas páginas nuevas se encontraron y un botón Revisar" width="1680" height="1114" data-path="images/es/ciarem-help-website-card.png" />

El diálogo de revisión agrupa las páginas nuevas igual que el selector de páginas. Selecciona las páginas de las que tu agente debería aprender y haz clic en **Agregar N páginas**. Ciarem indexa la fuente de nuevo con las páginas nuevas. Haz clic en **Ahora no** para omitirlas. Las páginas omitidas vuelven a aparecer en una revisión posterior si el sitio todavía las tiene.

<img src="https://mintcdn.com/ciaremaai/dAYM1i_8tIIG0EQ3/images/es/ciarem-help-website-new-pages.png?fit=max&auto=format&n=dAYM1i_8tIIG0EQ3&q=85&s=ea33d902d97a42f5487bca8835d3295a" alt="Revisando las páginas nuevas encontradas en el sitio, agrupadas por sección, antes de agregarlas" width="1680" height="1114" data-path="images/es/ciarem-help-website-new-pages.png" />

## Conviene saber

* Las fuentes de sitio web creadas antes de esta función conservan su única página. Para indexar todo el sitio, agrégalo de nuevo como una fuente de sitio web nueva y elimina la anterior.
* La búsqueda solo lee páginas públicas. Las páginas detrás de un inicio de sesión o un muro de pago no se encuentran.
* El rastreo semanal se ejecuta solo. No hay nada que programar.
