Learner Pipeline

LearnerPipeline supports:

  • retriever-only mode (set retriever_id)

  • llm-only mode (set llm_id)

  • rag mode (set both retriever_id and llm_id), or provide a prebuilt rag learner

LearnerPipeline

class ontolearner._learner.LearnerPipeline(retriever: ~typing.Any | None = None, llm: ~typing.Any | None = None, rag: ~typing.Any | None = None, retriever_id: str | None = None, llm_id: str | None = None, prompting: ~ontolearner.base.learner.AutoPrompt | None = <class 'ontolearner.learner.prompt.StandardizedPrompting'>, label_mapper: ~ontolearner.learner.label_mapper.LabelMapper | None = <ontolearner.learner.label_mapper.LabelMapper object>, hf_token: str | None = None, ontologizer_data: bool = True, top_k: int = 5, batch_size: int = 10, device: str = 'cpu', max_new_tokens: int = 10)[source]

Bases: object

Unified pipeline for ontology learning using retriever-only, LLM-only, or Retrieval-Augmented Generation (RAG) learners.

RAG can be configured in two ways: 1) pass both retriever and llm (or their model IDs), or 2) pass a prebuilt rag learner.

Initialize the pipeline for ontology learning tasks.

Parameters:
  • retriever – Pre-initialized retriever learner.

  • llm – Pre-initialized LLM learner.

  • rag – Pre-initialized AutoRAGLearner (or compatible) instance.

  • retriever_id – Retriever model ID used when loading retriever components.

  • llm_id – LLM model ID used when loading LLM components.

  • prompting – Prompting strategy for AutoLLMLearner initialization.

  • label_mapper – Label mapper for AutoLLMLearner initialization.

  • hf_token – Hugging Face token (for gated model access).

  • ontologizer_data – If True, uses Ontologizer-style datasets by default.

  • top_k – Number of top examples retrieved for retriever/RAG workflows.

  • batch_size – Batch size used by learner backends where applicable.

  • device – Target device for model execution (e.g., ‘cpu’, ‘cuda’).

  • max_new_tokens – Max generated tokens for LLM generation.