Ehi! In qualità di fornitore di trasformatori, mi viene spesso chiesto quali set di dati vengono comunemente utilizzati per addestrare i modelli Transformer. È un argomento molto interessante e oggi lo analizzerò per tutti voi.
Prima di tutto, capiamo perché i set di dati sono così importanti quando si tratta di addestrare i modelli Transformer. Questi modelli sono come studenti super-intelligenti, ma hanno bisogno di un sacco di dati per imparare davvero bene ed essere in grado di fare ogni genere di cose interessanti, come tradurre lingue, generare testi e persino rispondere alle tue domande proprio come sto facendo io adesso.
1. Set di dati di Wikipedia
Uno dei set di dati più popolari in circolazione sono i dati di Wikipedia. È enorme e copre una vasta gamma di argomenti. Hai articoli su storia, scienza, tecnologia, cultura e praticamente tutto quello che c'è sotto il sole. Anche il linguaggio utilizzato negli articoli di Wikipedia è piuttosto vario e ben strutturato.


Il bello dell'utilizzo dei dati di Wikipedia è che sono disponibili pubblicamente. Puoi semplicemente andare a raccogliere le informazioni di cui hai bisogno (ovviamente, seguendo le norme e i regolamenti appropriati). I modelli Transformer possono imparare molto da esso, incluso il vocabolario, la grammatica e la conoscenza di diversi campi. Ad esempio, se stai addestrando un modello a rispondere a domande di cultura generale, i dati di Wikipedia possono fornire una solida base. Il modello può rilevare il modo in cui sono correlati concetti diversi, ad esempio il modo in cui una particolare teoria scientifica è collegata alle sue applicazioni nel mondo reale.
2. Corpo dei libri
BookCorpus è un altro fantastico set di dati. Come suggerisce il nome, è composto da un'ampia collezione di libri. I libri sono diversi dagli articoli di Wikipedia. Spesso hanno una struttura narrativa e il linguaggio utilizzato può essere più creativo e ricco di sfumature.
Quando utilizzi BookCorpus per addestrare un modello Transformer, il modello può apprendere le tecniche di narrazione, lo sviluppo del personaggio e i diversi stili di scrittura. Questo è davvero utile se stai cercando di addestrare un modello per attività come la scrittura creativa o la generazione di testo in un contesto più letterario. Il modello può iniziare a imitare il flusso e il ritmo di libri ben scritti e può generare un testo che si legge in modo più fluido e coinvolgente.
3. Scansione comune
Common Crawl è un set di dati enorme. Si tratta fondamentalmente di un'enorme raccolta di pagine Web che vengono scansionate e archiviate regolarmente. La portata del Common Crawl è sconcertante. Ha petabyte di dati.
Il vantaggio di utilizzare Common Crawl è che rappresenta l'utilizzo della lingua nel mondo reale su Internet. Hai tutti i tipi di contenuti, da articoli di notizie e blog a post sui social media e recensioni di prodotti. Ciò significa che un modello Transformer addestrato su Common Crawl è in grado di comprendere e generare testo simile a ciò che le persone effettivamente scrivono e leggono online. Tuttavia, lo svantaggio è che i dati sono piuttosto rumorosi. C'è molta spazzatura, come spam, pubblicità e contenuti scritti male. Pertanto, è necessario eseguire molta pulizia e preelaborazione prima di utilizzarlo per addestrare il modello.
4. Set di dati sui volti abbracciati
Hugging Face ha questa fantastica raccolta di set di dati. Hanno curato un sacco di set di dati diversi per compiti diversi. Hai set di dati per l'analisi del sentiment, il riconoscimento delle entità denominate e la traduzione automatica, solo per citarne alcuni.
La cosa bella dei set di dati di Hugging Face è che sono facili da accedere e utilizzare. Hugging Face fornisce una libreria Python che ti consente di scaricare e preelaborare i set di dati con solo poche righe di codice. Hanno anche molta documentazione ed esempi, quindi anche se sei nuovo nel lavorare con i set di dati, puoi iniziare abbastanza rapidamente. Questi set di dati sono anche ben organizzati e spesso sono dotati di suddivisioni predefinite per formazione, convalida e test, il che rende il processo di formazione molto più semplice.
5. Set di dati TREC (Text REtrieval Conference).
I set di dati TREC vengono utilizzati principalmente per il recupero di informazioni e attività di risposta a domande. Contengono una raccolta di documenti e una serie di domande a cui rispondere sulla base di tali documenti.
Questi set di dati sono ottimi perché sono progettati specificamente per testare e addestrare modelli su come trovare informazioni rilevanti in un ampio insieme di testi. I modelli Transformer addestrati sui set di dati TREC possono diventare davvero efficaci nella scansione rapida dei documenti e nell'estrazione delle risposte più pertinenti. Ciò è estremamente utile in applicazioni come motori di ricerca e biblioteche digitali, dove gli utenti cercano informazioni specifiche.
Ora lasciate che vi parli brevemente dei trasformatori che forniamo. Abbiamo alcuni prodotti di altissima qualità, come ilTrasformatore di alimentazione veloce e silenzioso, risposta rapida, ultra silenzioso. Questo trasformatore non è solo veloce ma anche ultra silenzioso, perfetto per luoghi in cui il rumore può essere un problema.
Abbiamo anche ilTrasformatore riempito d'olio. Questi tipi di trasformatori sono ottimi per applicazioni ad alta potenza. Sono progettati per gestire grandi quantità di elettricità e sono molto affidabili.
E per coloro che hanno bisogno di ancora più potenza, abbiamo ilTrasformatore di distribuzione dell'alimentazione riempito d'olio ad alta capacità. Questo cattivo ragazzo può distribuire un'enorme quantità di energia, rendendolo ideale per l'uso industriale.
Se sei interessato a uno qualsiasi di questi prodotti o se hai domande sui set di dati per l'addestramento dei modelli Transformer, non esitare a contattarci. Siamo qui per aiutarti a prendere le decisioni migliori per le tue esigenze. Che tu sia un ricercatore che desidera addestrare il prossimo grande modello di Transformer o un'azienda che necessita di trasformatori di alta qualità, abbiamo la soluzione per te. Iniziamo una conversazione e vediamo come possiamo lavorare insieme!
Riferimenti
- Brown, Tom B., et al. "I modelli linguistici sono pochi: spara agli studenti." Progressi nei sistemi di elaborazione delle informazioni neurali 33 (2020): 1877 - 1901.
- Raffel, Colin et al. "🤗 Dataset: una comunità-biblioteca per l'elaborazione del linguaggio naturale." prestampa di arXiv arXiv:2010.10759 (2020).
- Callan, Jamie et al. "TREC - Rapporto sul percorso di risposta a 8 domande." Conferenza sul recupero del testo. vol. 8.2000.






