Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O IDP (Processamento Inteligente de Documentos) converte conteúdo não estruturado, como PDFs, arquivos DOCX, imagens e apresentações, em dados estruturados e enriquecidos que alimentam agentes downstream, aplicativos e análises.
O Azure Databricks oferece duas formas de rodar o IDP, ambas baseadas nas mesmas Funções de IA desenvolvidas por pesquisa:
- Agent Bricks UI: Uma experiência visual sem código para analisar, extrair e classificar documentos. Use-o para testar documentos de exemplo, refinar um esquema ou rótulos e validar visualmente os resultados antes de escalar.
- Funções de IA SQL: Execute funções inteligentes de processamento de documentos diretamente no Lakehouse. Use-os para processar documentos em escala, combinar estágios juntos e criar pipelines governados e prontos para produção em pipelines do Lakeflow.
Capacidades inteligentes de processamento de documentos
| Capacidade | Interface do usuário do Agent Bricks | Função SQL |
|---|---|---|
| Converta PDFs, DOCX, imagens e PPTs em descrições estruturadas de texto, tabelas e figura. | Análise Sintática de Documentos | ai_parse_document |
| Extrair campos estruturados de documentos ou de texto sem formatação usando um esquema que você define. | Extração de informações | ai_extract |
| Atribua categorias predefinidas a documentos ou texto, dando suporte a mais de 500 rótulos. | Classificação | ai_classify |
| Transforme documentos analisados em blocos semânticos prontos para geração aumentada por recuperação (RAG) e indexação de busca por IA. |
ai_prep_search (Beta) |
Casos de uso comuns
O IDP no Azure Databricks alimenta uma ampla gama de aplicativos downstream:
- RAG (geração aumentada de recuperação): analisar e estruturar documentos para melhorar a segmentação, a qualidade de recuperação e a contextualização para aplicativos LLM.
- Extração e análise de conhecimento: extraia os principais campos e metadados para habilitar a pesquisa, os relatórios e o business intelligence nos dados do documento.
- Fluxos de trabalho controlados por agente: rotear, classificar e enriquecer documentos para dar suporte à tomada de decisão automatizada e à execução de tarefas.
- Compreensão e classificação de documentos: organize grandes corpora de documentos por tipo, tópico ou conteúdo para processamento subsequente.
Como funciona
O Azure Databricks permite o processamento inteligente de documentos como um fluxo de trabalho unificado de ponta a ponta no Lakehouse. A ingestão, a análise, o enriquecimento e a análise downstream são criadas em uma única plataforma, portanto, cada estágio funciona perfeitamente em conjunto sem a necessidade de integração complexa ou movimentação de dados.
Ingestão e orquestração
Use os pipelines do Lakeflow para fazer a ingestão de documentos brutos (como PDFs, imagens e arquivos DOCX) e orquestrar seus pipelines. Como a ingestão e a orquestração são integradas nativamente ao Lakehouse, os documentos fluem diretamente para o processamento downstream sem infraestrutura adicional.
Analisar documentos (camada Bronze)
Aplique-se
ai_parse_documentpara converter arquivos brutos em representações estruturadas. Isso cria uma camada de bronze padronizada que captura texto, tabelas/descrições de imagem e estrutura de documentos, formando uma base consistente para todos os casos de uso downstream.Extrair e classificar
Use
ai_extracteai_classifypara enriquecer documentos analisados com campos estruturados e metadados. Essas funções operam diretamente nas saídas analisadas, permitindo extrair informações importantes, classificar documentos e roteá-los por meio de fluxos de trabalho sem etapas de transformação adicionais.Preparar-se para a recuperação (RAG)
Aplique
ai_prep_search(Beta) para transformar documentos analisados em partes semânticas enriquecidas com contexto no nível do documento, como títulos, cabeçalhos de seção e referências de página. A saída é formatada para a indexação da Pesquisa de IA, servindo como uma base consistente para cargas de trabalho de RAG e recuperação.Analisar e operacionalizar
Aproveite funções adicionais de IA ou outras ferramentas (painéis de IA/BI, aplicativos, busca com IA) para análises posteriores, recuperação (RAG) e fluxos de trabalho orientados por agentes. Como todos os dados permanecem no Lakehouse, os dados estruturados do documento podem ser imediatamente usados para pesquisa, dashboards e aplicativos.