Planejar a importação de uma planilha com IA

Um prompt seguro para criar um fluxo reproduzível com OpenDataBio-R

Uma IA pode examinar uma planilha desconhecida e propor código R para transformá-la, validá-la e importá-la. Trate a resposta como um plano, não como dados validados. Nunca forneça token, senha, coordenadas sensíveis, dados pessoais ou inéditos a um serviço não autorizado. Preserve uma cópia imutável da fonte e revise todo o código gerado.

Modelo de prompt

Anexe o CSV ou XLSX e substitua o texto entre colchetes. Se a IA não ler anexos, forneça nomes das abas e colunas e uma pequena amostra sem dados sensíveis.

Ajude-me a preparar uma importação reproduzível e auditável no OpenDataBio
usando R e o pacote R opendatabio.

Considere que sou iniciante em R e em organização de dados. Estou usando um
chatbot online comum, possivelmente gratuito, que não executa R, não mantém
arquivos entre conversas e pode ter limite de mensagens. Não pressuponha que eu
saiba usar terminal, projetos do RStudio, diretório de trabalho, pacotes ou
objetos do OpenDataBio. Use linguagem simples e explique termos técnicos na
primeira vez em que aparecerem.

Arquivo: anexo. URL base da API: [URL]. Projeto: [nome ou ID]. Dataset: [nome
ou ID]. Os dados descrevem [descrição]. Cada linha representa [significado].
[Informe unidades, códigos, convenções de ausentes e escopo geográfico ou
taxonômico conhecidos.]

Use estas fontes oficiais como contexto técnico obrigatório:

- Documentação do OpenDataBio: https://opendatabio.gitlab.io/docs/
- Visão geral da API: https://opendatabio.gitlab.io/docs/api/
- Campos e regras dos endpoints POST: https://opendatabio.gitlab.io/docs/api/post-data/
- Fluxo de importação: https://opendatabio.gitlab.io/docs/guides/data-import-workflow/
- Tutoriais de importação com R: https://opendatabio.gitlab.io/docs/tutorials/02-post-data-r-vignette/
- Código-fonte e README do OpenDataBio-R: https://gitlab.com/opendatabio/opendatabio-r

Abra e consulte essas URLs antes de propor código. Prefira essas fontes ao seu
conhecimento geral ou a exemplos de terceiros. Para cada função odb_* e campo
da API propostos, indique a página oficial que os documenta. Se não conseguir
acessar uma URL, informe e peça que eu forneça seu conteúdo; não adivinhe.
Registre qualquer aparente incompatibilidade de versões entre a documentação do
servidor e o pacote R.

Ainda não importe nada. Nunca solicite nem imprima meu token; use
Sys.getenv("ODB_TOKEN"). Não invente IDs, correspondências, unidades, datas,
coordenadas ou ausentes. Marque incertezas para minha revisão.

Primeiro examine todas as abas e informe dimensões, possível cabeçalho, colunas
vazias ou duplicadas, tipos inferidos, códigos de ausentes e uma amostra sem
dados sensíveis. Explique o que cada linha representa e sinalize colunas com
múltiplas entidades.

Proponha uma tabela com coluna de origem, objeto e campo OpenDataBio,
transformação, obrigatoriedade, confiança e perguntas. Confira os campos na API
POST e na documentação do cliente R; não invente campos. Crie source_row_id
estável, preserve valores originais ao lado dos normalizados e documente cada
transformação.

Separe tabelas por dependência. Pesquise Pessoas, Referências, Taxons,
Localidades e Traits existentes antes de criar registros; depois trate relações
de Projeto/Dataset, Indivíduos/ocorrências, Vouchers/identificações e, por fim,
Medições/Mídias/nomes populares. Gere tabelas de correspondências, ausências e
ambiguidades. Nunca resolva ambiguidade automaticamente nem use posição como
chave.

Quando houver coordenadas, use locations-validation e sinalize intervalos
inválidos, eixos trocados, geografia inesperada, duplicatas e precisão
inadequada, sem correções silenciosas.

Antes de qualquer POST, valide localmente e grave mapping_review.csv,
validation_errors.csv, ambiguous_matches.csv e import_plan.csv. Proteja toda
gravação com RUN_IMPORT <- FALSE; com FALSE nenhum POST ou PUT pode executar.

Após minha aprovação, importe um lote piloto representativo, guarde cada ID de
UserJob, acompanhe a tarefa, baixe resultados por linha e associe-os por
source_row_id, mantendo odb_status, odb_id, odb_uuid, odb_error e odb_warning.
Interrompa dependências se pré-requisitos falharem; reenvie somente linhas
pendentes corrigidas; nunca apague ou sobrescreva registros. Consulte por GET os
registros criados ou reutilizados, verifique campos e contagens e grave relatório
de reconciliação e sessionInfo().

Organize 00_config.R, 01_inspect.R, 02_transform.R, 03_match_validate.R,
04_pilot_import.R, 05_full_import.R e 06_verify.R, com dependências e instruções.

Além dos scripts, produza um guia operacional passo a passo para iniciantes.
Comece por instalação do R e RStudio, instalação/atualização dos pacotes,
criação de uma pasta exclusiva para a importação, colocação da planilha nessa
pasta e configuração segura de ODB_TOKEN. Forneça somente comandos completos
que eu possa copiar e colar. Diga exatamente em qual programa, arquivo ou
console devo colar cada comando e nunca use apenas expressões vagas como
"configure o ambiente" ou "execute o script".

Apresente uma etapa por vez, nesta ordem: objetivo; arquivos que serão lidos ou
criados; bloco exato para copiar; como executar; resultado esperado; como saber
se funcionou; erros comuns e como corrigi-los; e um ponto de parada. Ao final de
cada etapa, peça que eu cole apenas a mensagem de erro ou o resumo produzido e
espere minha confirmação antes da próxima. Não peça que eu cole token, dados
sensíveis ou a tabela inteira. Se a conversa perder contexto, forneça um pequeno
resumo que eu possa copiar para iniciar uma nova conversa.

Nunca mande executar todos os scripts de uma vez. As etapas 01 a 03 e o teste
com RUN_IMPORT <- FALSE devem ser concluídos antes do lote piloto. Antes do
primeiro POST, mostre uma caixa de verificação em linguagem simples e peça uma
confirmação explícita. Antes da importação completa, exija nova confirmação
após a revisão do piloto. Explique como interromper com segurança, continuar
depois e localizar os arquivos de revisão e resultados.

Antes dos scripts, mostre: (a) interpretação da planilha, (b) ordem e mapeamento,
(c) suposições e ambiguidades e (d) perguntas que devo responder. Aguarde minhas
respostas antes de finalizar mapeamentos de baixa confiança.

Execute primeiro com RUN_IMPORT <- FALSE e depois com um lote piloto. Confirme que as funções existem na versão instalada do OpenDataBio-R e correspondem à API POST do servidor. Um UserJob bem-sucedido ainda pode conter avisos ou registros reutilizados; reconcilie cada linha. Veja também o fluxo de importação.

Última modificação August 13, 2026: PlantNet implemented & IA prompt guidelines (6d5d42b)