scription

Thesis Title Ideation — July 8, 2026

Generated from 1,000 real arXiv papers (20 Tirana-aligned queries × 50 results). Queries are tailored to Tirana Noor Fatyanosa, S.Kom., M.Kom., Ph.D.’s research areas: RoBERTa/IndoBERT emotion, BERT text classification, BERT2BERT dialogue, HDBSCAN clustering, cyber log analysis, low-resource Indonesian NLP. UB Informatics thesis topics at repository.ub.ac.id guided query selection.


🧠 RoBERTa, Emotion Detection & Sentiment Analysis

  1. RoBERTa-MultiEmo: A Hierarchical Multi-Class Emotion Detection Framework for English Social Media TextGap: Tirana’s UB thesis (Farid Muzaki, 2026) applies RoBERTa for English emotion; no comprehensive multi-dataset benchmark with class imbalance handling.
  2. IndoBERT-Sentiment-Attention: Visualizing Attention Mechanisms for Explainable Indonesian Sentiment AnalysisGap: Tirana UB thesis (Brigitta Nilapaksi, 2026) uses IndoBERT for Twitter sentiment; explainability via attention visualization is absent.
  3. Cross-Lingual Emotion Transfer: Fine-Tuning RoBERTa for Indonesian Social Media Emotion DetectionGap: RoBERTa for English emotion is well-studied; cross-lingual zero-shot to Indonesian is unexplored.
  4. Emotion-Cause Pair Extraction in Code-Mixed Indonesian-English Text Using Fine-Tuned BERTGap: Emotion analysis UB theses (2024-2026) don’t explore emotion-cause pairs or code-mixed data.
  5. IndoMultiEmo: A Multi-Label Emotion Dataset for Indonesian Using Distant Supervision from EmojisGap: No large-scale Indonesian multi-label emotion dataset exists; current UB theses use limited labeled data.
  6. Comparative Study of RoBERTa, IndoBERT, and mBERT for Emotion Detection in Indonesian Short TextsGap: Tirana’s UB thesis uses RoBERTa for English; systematic comparison for Indonesian is missing.
  7. Few-Shot Emotion Recognition in Indonesian Using Prompt-Based Learning with Pretrained Language ModelsGap: Low-resource emotion recognition (UB Tirana 2026 focus on limited data) with prompt tuning is novel.
  8. Aspect-Based Sentiment Analysis for Indonesian Product Reviews Using IndoBERT Augmented with Syntax TreesGap: IndoBERT sentiment (Tirana 2026) is sentence-level; aspect-based analysis with syntax augmentation is a gap.
  9. Temporal Sentiment Analysis of Indonesian Twitter Data Using Incrementally Fine-Tuned IndoBERTGap: Tirana’s sentiment thesis is static; temporal/dynamic sentiment tracking via incremental learning is unexplored.
  10. Multi-Task Emotion and Sentiment Joint Learning for Indonesian Using Shared BERT EncodersGap: Emotion and sentiment are treated separately in UB theses; joint multi-task learning is a methodological gap.
  11. Sarcasm-Aware Sentiment Detection in Indonesian Social Media Using RoBERTa with Contrastive LearningGap: Sarcasm detection is absent from Indonesian emotion/sentiment literature found in UB repository.
  12. Domain-Adaptive Pretraining of IndoBERT for Financial Sentiment Analysis in IndonesianGap: IndoBERT fine-tuning (Tirana 2026) focuses on general Twitter; domain-specific (finance) adaptation is a gap.
  13. Lightweight Distilled RoBERTa for Real-Time Indonesian Emotion Detection on Edge DevicesGap: RoBERTa emotion model (Tirana 2026) is resource-heavy; edge deployment via distillation is unexplored.
  14. Ensemble of Multilingual BERT Variants for Robust Emotion Detection Across Indonesian Regional LanguagesGap: Indonesian emotion detection (UB theses) covers Bahasa only; Javanese/Sundanese emotion is open.
  15. Active Learning for Efficient Annotation of Indonesian Emotion Datasets Using Uncertainty SamplingGap: UB Tirana thesis (Rizky Dwi Purnomo, 2024) compares preprocessing/fine-tuning but not active learning for annotation efficiency.

📊 BERT Fine-Tuning & Text Classification

  1. Beyond Token-Level: Investigating the Effect of Preprocessing Strategies on BERT Fine-Tuning for Indonesian Text ClassificationGap: Rizky Dwi Purnomo’s UB thesis (2024) compares preprocessing methods; no systematic study on preprocessing effects across multiple BERT variants.
  2. Parameter-Efficient Fine-Tuning for Indonesian BERT: LoRA, Adapters, and Prefix Tuning ComparedGap: Tirana UB thesis (2024) uses full fine-tuning; PEFT methods like LoRA are untested for Indonesian BERT classification.
  3. Data Augmentation Strategies for Limited-Dataset BERT Fine-Tuning in Indonesian NLPGap: Tirana’s UB thesis on limited data NLP (2026) suggests data scarcity; augmentation strategies for Indonesian are unstudied.
  4. Robustness Evaluation of Fine-Tuned BERT Models Under Adversarial Input Perturbations in IndonesianGap: BERT text classification (UB theses) doesn’t evaluate adversarial robustness for Indonesian language inputs.
  5. Semi-Supervised BERT Fine-Tuning with Self-Training for Indonesian Text Classification with Limited LabelsGap: Limited data is a recurring theme in Tirana’s supervision; semi-supervised BFT for Indonesian is absent.
  6. Cross-Domain Transfer Learning for BERT Text Classification: From Indonesian News to Legal DocumentsGap: UB Tirana BERT classification thesis covers general text; cross-domain transfer for specific domains is a gap.
  7. Multi-Task Text Classification for Indonesian Using Shared BERT Layers with Task-Specific HeadsGap: All UB BERT theses are single-task; multi-task classification with shared encoder is underexplored.
  8. Calibrating Fine-Tuned BERT Confidence Scores for Indonesian High-Stakes Classification TasksGap: Model calibration (confidence scoring) is not addressed in UB text classification theses.
  9. Continual Fine-Tuning of Indonesian BERT: Avoiding Catastrophic Forgetting Across Sequential TasksGap: UB Tirana theses do one-shot fine-tuning; continual learning for BERT in Indonesian is novel.
  10. IndoBERT vs. XLM-R vs. mBERT: A Fair Benchmark for Indonesian Text Classification Under Controlled PreprocessingGap: Tirana’s 2024 thesis compares preprocessing but not comprehensively across model architectures.
  11. Uncertainty-Aware Fine-Tuning of BERT for Indonesian Text Classification with Rejection OptionGap: No Indonesian BERT classification study incorporates prediction uncertainty or rejection of low-confidence samples.
  12. Federated BERT Fine-Tuning for Privacy-Preserving Indonesian Text ClassificationGap: Federated BFT (arXiv papers) exists for English; no study applies federated fine-tuning to Indonesian data.
  13. Class-Imbalanced BERT Fine-Tuning for Indonesian Text: A Comparative Study of Cost-Sensitive and Resampling MethodsGap: UB Rizky Dwi Purnomo’s thesis (2024) doesn’t address class imbalance, a practical issue in real Indonesian datasets.
  14. Curriculum Learning for Progressive BERT Fine-Tuning on Indonesian Text ClassificationGap: Curriculum learning ordering of training data for BFT is unexplored for Indonesian.
  15. Green AI for Indonesian BERT Fine-Tuning: Energy-Efficient Training with Early Stopping and PruningGap: Computational cost of BFT (Tirana 2024) is not analyzed; energy-efficient fine-tuning is an underexplored direction.

💬 Dialogue Generation & BERT2BERT

  1. BERT2BERT-Indo: Enhancing Encoder-Decoder Pretraining for Indonesian Chatbot Response GenerationGap: Femi Novia Lina’s UB thesis (2024) applies BERT2BERT for Indonesian dialogue; limited dataset size is the key challenge.
  2. Data-Efficient BERT2BERT Fine-Tuning for Indonesian Task-Oriented Dialogue with Prompt-Based InitializationGap: UB BERT2BERT thesis uses limited data (2024); prompt-based few-shot dialogue is a gap.
  3. Evaluating BERT2BERT, T5, and GPT-2 for Indonesian Open-Domain Dialogue GenerationGap: BERT2BERT for Indonesian (UB 2024) hasn’t been compared against T5 or GPT-2 variants.
  4. Hybrid Retrieval-Augmented BERT2BERT for Indonesian Knowledge-Grounded DialogueGap: Tirana UB BERT2BERT thesis is purely generative; RAG-enhanced dialogue with retrieval is unexplored.
  5. Multitask BERT2BERT for Joint Intent Classification and Response Generation in IndonesianGap: UB dialogue thesis (2024) does single-task generation; joint intent+response multitask is a gap.
  6. Controllable Indonesian Dialogue Generation with BERT2BERT Using Attribute-Conditioned DecodingGap: BERT2BERT response generation (UB 2024) doesn’t support controllable attributes like tone or formality.
  7. Low-Resource Indonesian Chatbot Training Using Back-Translation and Self-Training with BERT2BERTGap: Data scarcity is the core limitation of UB BERT2BERT thesis (2024); data augmentation via back-translation is unexplored.
  8. Dialogue State Tracking for Indonesian Task-Oriented Chatbots Using Fine-Tuned BERTGap: UB BERT2BERT thesis covers response generation but not dialogue state tracking for task completion.
  9. IndoPersonaChat: A Persona-Consistent Dialogue Dataset for Indonesian Using BERT2BERTGap: No persona-based Indonesian dialogue dataset exists; BERT2BERT fine-tuning with persona context is novel.
  10. Evaluation Metrics for Indonesian Open-Domain Dialogue: Human Judgement vs. Automated MetricsGap: UB Tirana thesis (2024) uses automated metrics; human evaluation framework for Indonesian dialogue is missing.

🔒 Clustering, HDBSCAN & Cybersecurity

  1. HDBSCAN vs. DBSCAN for Web Server Log Anomaly Detection: A Comparative StudyGap: Naufal Akmal’s UB thesis (2026) uses HDBSCAN for cyber log investigation; no systematic comparison against DBSCAN variants exists.
  2. Deep Embedding + HDBSCAN: A Hybrid Approach for Unsupervised Cyber Threat ClusteringGap: Tirana’s UB cyber thesis (2026) uses raw HDBSCAN; deep embedding pre-clustering is an underexplored enhancement.
  3. Transformer-Based Log Embeddings for HDBSCAN Clustering of Web Server AttacksGap: UB cyber investigation thesis uses log features directly; transformer (BERT) log embeddings for HDBSCAN are novel.
  4. Temporal HDBSCAN: Time-Aware Clustering of Sequential Cyber Attack PatternsGap: HDBSCAN is static; time-aware clustering of attack sequences is a methodological gap.
  5. Visual Analytics Dashboard for HDBSCAN Clustering of Cyber Security LogsGap: UB cyber thesis (2026) produces cluster output; interactive visualization for security analysts is absent.
  6. Incremental HDBSCAN for Real-Time Web Server Log Anomaly DetectionGap: HDBSCAN (UB 2026) is batch; incremental/online version for real-time detection is a gap.
  7. Parameter-Free HDBSCAN: Automatic MinPts Selection for Cyber Log ClusteringGap: HDBSCAN requires parameter tuning (min cluster size); automated selection for cyber logs is unexplored.
  8. Explainable Log Anomaly Detection: Interpreting HDBSCAN Clusters with SHAP ValuesGap: UB cyber thesis (2026) detects but doesn’t explain clusters; XAI for clustering is a gap.
  9. Multi-Source Log Fusion for Clustering: Combining Web Server, Database, and Firewall LogsGap: UB thesis (2026) focuses on web server logs; multi-source log clustering is an extension gap.
  10. Benchmarking Clustering Algorithms for Indonesian University Cyber Attack LogsGap: UB repository shows cyber investigation (2026) on general logs; no benchmark exists for Indonesian academic network data.
  11. Graph-Based Clustering of Network Attack Patterns Using HDBSCAN on Flow DataGap: Tirana UB thesis (2026) clusters log text; graph-structured attack patterns with HDBSCAN are a gap.
  12. Semi-Supervised HDBSCAN with Constrained Clustering for Labeled Cyber Threat IntelligenceGap: UB thesis uses unsupervised HDBSCAN; semi-supervised constraints from known attack signatures are underexplored.
  13. HDBSCAN-Based Feature Selection for High-Dimensional Cyber Log DataGap: Dimensionality reduction before HDBSCAN clustering is not addressed in UB cyber thesis (2026).
  14. Adaptive Thresholding for HDBSCAN in Non-Stationary Web Server Log EnvironmentsGap: HDBSCAN assumes stable density; adaptive thresholds for concept drift in logs is a gap.
  15. Ensemble Clustering for Cyber Attack Detection: Combining HDBSCAN with K-Means and Spectral ClusteringGap: UB thesis (2026) uses single algorithm; ensemble clustering for robustness is unexplored.

🌏 Low-Resource Indonesian NLP

  1. IndoLimited: A Benchmark for Low-Resource Indonesian NLP with Controlled Dataset SizesGap: Tirana UB thesis on limited data NLP (2026) lacks a standardized low-resource benchmark.
  2. Cross-Lingual Transfer from English to Indonesian for NER: When Does It Work Best?Gap: Multilingual BERT fine-tuning (UB Tirana area) for cross-lingual NER transfer is unstudied.
  3. Adapter-Based Multilingual BERT for Indonesian Regional Languages: Parameter-Efficient Cross-Lingual TransferGap: Parameter-efficient fine-tuning for Indonesian NLP (Tirana 2026 focus) not tested for regional languages.
  4. IndoFewShot: A Few-Shot Learning Benchmark for Indonesian Text ClassificationGap: Limited data (UB Tirana 2026) motivates few-shot learning; no few-shot benchmark exists for Indonesian.
  5. Self-Training with Noise for Low-Resource Indonesian NER Using IndoBERTGap: Tirana’s limited data NLP thesis (2026) can be extended with self-training approaches.
  6. Generative Data Augmentation Using LLMs for Indonesian Text Classification with Limited Training DataGap: UB limited data thesis doesn’t use LLM-based augmentation; synthetic data generation is a gap.
  7. IndoZeroShot: Zero-Shot Cross-Lingual Transfer for Indonesian NLU Using Multilingual EncodersGap: Cross-lingual NLU evaluation (Tirana 2026) can be extended to zero-shot transfer scenarios.
  8. Ensemble of Weakly Supervised Models for Indonesian Text Classification with Minimal AnnotationsGap: Limited data context (UB Tirana 2026) benefits from weak supervision; not yet explored.
  9. Label-Efficient Indonesian Sentiment Analysis Using Contrastive Pretraining on Unlabeled DataGap: Contrastive learning for label efficiency in Indonesian NLP is absent from literature.
  10. In-Context Learning vs. Fine-Tuning for Few-Shot Indonesian Text Classification with LLMsGap: Limited data (UB 2026) comparison between ICL and fine-tuning for Indonesian is a gap.
  11. Domain-Specific Indonesian BERT Pretraining with Limited Compute Using Curriculum MaskingGap: Pretraining IndoBERT (rather than fine-tuning) on limited compute is novel for Indonesian NLP.
  12. IndoDataFree: Zero-Resource Indonesian Text Classification Using Cross-Lingual Embedding AlignmentGap: No Indonesian-labeled data scenarios are unexplored; CL alignment for zero-resource classification is a gap.
  13. Meta-Learning for Rapid Adaptation of Indonesian NLP Models to New DomainsGap: Meta-learning for low-resource Indonesian NLP adaptation (MAML, Reptile) is untested.
  14. Privacy-Preserving Indonesian NLP: On-Device Fine-Tuning with Federated Learning for Limited DataGap: Limited data + privacy (UB Tirana areas) combine for on-device federated learning in Indonesian.
  15. IndoAugment: A Comprehensive Data Augmentation Toolkit for Indonesian NLPGap: No toolkit exists for Indonesian-specific data augmentation (unlike NL-Augmenter for English).

⚙️ Cross-Domain & Applied (Aligned to Tirana’s Supervision)

  1. IndoBERT-Clinical: Fine-Tuning BERT for Indonesian Clinical Text ClassificationGap: BERT clinical text survey (Tirana 2026) covers general clinical; no Indonesian clinical BERT exists.
  2. RoBERTa for Indonesian Fake News Detection: A Multi-Aspect Attention ApproachGap: RoBERTa emotion (Tirana UB 2026) can extend to fake news detection; no Indonesian benchmark exists.
  3. BERT2BERT with External Knowledge for Indonesian Customer Service ChatbotGap: BERT2BERT dialogue (UB 2024) without knowledge grounding; KIBERT extension is a gap.
  4. HDBSCAN Clustering of Indonesian Social Media Bots Based on Behavioral PatternsGap: HDBSCAN for cyber (UB 2026) on server logs; applying to social media bot detection in Indonesian is novel.
  5. IndoBERT for Indonesian Legal Document Classification: A Comparative Study of Fine-Tuning StrategiesGap: BERT classification (Tirana 2024) on general data; legal domain adaptation is unexplored.
  6. Emotion-Aware Indonesian Chatbot Using Fine-Tuned IndoBERT with Emotion EmbeddingsGap: Combines Tirana’s two tracks: BERT2BERT dialogue (2024) + emotion detection (2026).
  7. Lightweight Indonesian BERT for Mobile Deployments: Knowledge Distillation with Limited Teacher DataGap: Limited data (Tirana 2026) + model compression; knowledge distillation for Indonesian BERT is a gap.
  8. Indonesian Cyber Threat Intelligence Classification Using Fine-Tuned xlm-RoBERTaGap: Cyber log clustering (UB 2026) + cross-lingual models; CTI classification in Indonesian is a gap.
  9. Active Learning for Indonesian NER in Biomedical Texts with Limited AnnotationsGap: Limited data NLP (Tirana 2026) + active learning; biomedical NER for Indonesian is absent.
  10. IndoCOVID-Tweet: Fine-Grained Sentiment Analysis of Indonesian COVID-19 Tweets Using IndoBERTGap: IndoBERT sentiment (UB 2026) applied to health crisis tweets; domain-specific fine-tuning for pandemics is a gap.
  11. Multilingual BERT for Indonesian Offensive Language Detection in Code-Mixed Social MediaGap: Emotion classification (UB 2026) can extend to offensive language; code-mixed detection is a gap.
  12. Parameter-Efficient Fine-Tuning of Indonesian BERT for Multi-Domain Text Classification with AdaptersGap: Parameter-efficient tuning (Tirana aligned) for multi-domain classification with domain-specific adapters.
  13. Semi-Supervised Clustering for Indonesian News Topic Discovery Using Sentence-BERT + HDBSCANGap: HDBSCAN (UB 2026) + SBERT embeddings for Indonesian news topic clustering is a gap.
  14. Fine-Grained Emotion Trajectory Prediction in Indonesian Narrative Text Using RoBERTaGap: RoBERTa emotion (2026) as static; emotion trajectory over narrative progression is novel.
  15. Indonesian Hate Speech Detection Using IndoBERT with Graph Neural Network for Social Network ContextGap: IndoBERT sentiment (UB 2026) doesn’t incorporate social graph context; GNN+IndoBERT is a gap.
  16. Low-Resource Indonesian Summarization Using BART with Limited Parallel DataGap: Limited data NLP (Tirana 2026) for summarization; BART fine-tuning for Indonesian with little data.
  17. Explainable Indonesian Sentiment Analysis Using Attention Rollout and LIME with IndoBERTGap: Explainable BERT (Tirana 2026 aligned) applied to Indonesian sentiment; no existing XAI benchmark.
  18. Cross-Lingual Emotion Transfer from English RoBERTa to Indonesian Using Adapter LayersGap: RoBERTa emotion (2026) for English; cross-lingual transfer to Indonesian using adapters is a gap.
  19. IndoBERT for Student Feedback Sentiment Analysis in Indonesian Higher EducationGap: Applied sentiment analysis (UB context) for Indonesian education feedback; nearest to Tirana’s UB environment.
  20. Federated HDBSCAN for Privacy-Preserving Cross-Organization Cyber Log ClusteringGap: HDBSCAN (UB 2026) + federated learning; privacy-preserving clustering across universities is a gap.
  21. Continual Few-Shot Learning for Indonesian Text Classification: Adapting to New Topics Without ForgettingGap: Limited data (Tirana 2026) + continual learning; few-shot incremental learning for Indonesian is a gap.
  22. IndoBERT for Indonesian Hoax Detection with Stance-Aware Multi-Task LearningGap: Sentiment (UB 2026) + stance detection + fact-checking; multi-task hoax detection is a gap.
  23. Self-Supervised Pretraining of Indonesian BERT on Domain-Specific Corpora with Limited ComputeGap: Pretraining from scratch (rather than fine-tuning) for Indonesian under compute constraints.
  24. HDBSCAN for Log Pattern Discovery in Indonesian E-Government SystemsGap: Cyber log clustering (UB 2026) applied to Indonesian e-government security; practical deployment gap.
  25. Multilingual Emotion Recognition in Indonesian YouTube Comments Using Cross-Lingual EmbeddingsGap: Emotion detection (UB 2026) on YouTube; code-mixed content with Indonesian/English is a gap.
  26. Incremental Fine-Tuning of Indonesian BERT for Evolving News ClassificationGap: BERT classification (Tirana 2024) is static; dynamic fine-tuning for evolving news topics is a gap.
  27. RoBERTa with Contrastive Learning for Indonesian Stance Detection in Social Media DebatesGap: RoBERTa emotion (2026) can extend to stance detection; contrastive learning for stance is a gap.
  28. Indonesian Chatbot for Mental Health Support Using BERT2BERT with Empathetic Response GenerationGap: BERT2BERT (UB 2024) + emotion (2026); empathetic mental health chatbot for Indonesian is a gap.
  29. Zero-Shot Indonesian Intent Classification Using Multilingual LLMs with Chain-of-Thought PromptingGap: Limited data NLP (Tirana 2026) for intent classification; zero-shot with CoT prompting is a gap.
  30. End-to-End Indonesian BERT Fine-Tuning Pipeline: From Preprocessing to DeploymentGap: Tirana’s BERT classification thesis (2024) focuses on comparison; an end-to-end pipeline with best practices is a gap.

📚 Surveys (Tirana-Aligned)

  1. Indonesian LLM Evaluation: A Systematic Survey of Benchmarks and DatasetsGap: Indonesian LLM evaluation survey (Tirana 2026 query); no comprehensive survey exists for Indonesian.
  2. BERT for Clinical Text in Low-Resource Languages: A Survey with Focus on Indonesian HealthcareGap: BERT clinical survey (Tirana 2026); Indonesian healthcare NLP survey is missing.
  3. Deep Learning for Cybersecurity in Indonesia: A Systematic Literature ReviewGap: Cyber DL survey (Tirana 2026); Indonesia-specific cybersecurity DL survey is absent.
  4. Low-Resource Language Fine-Tuning: Methods, Challenges, and Opportunities — A SurveyGap: Low-resource fine-tuning survey (Tirana 2026) but no survey focuses on Indonesian/Malay languages.
  5. Deep Learning for Text Emotion Recognition: A Comprehensive Survey with a Low-Resource PerspectiveGap: Emotion DL survey (Tirana 2026) covers English; low-resource perspective is a gap.
  6. From BERT to LLMs: The Evolution of Indonesian NLP — A Survey (2020-2026)Gap: UB theses track Indonesian NLP evolution but no comprehensive survey covers the transition.
  7. Parameter-Efficient Fine-Tuning of Transformer Models: A Survey for Low-Resource NLPGap: PEFT for low-resource NLP is a fast-growing field; no survey focuses on under-represented languages.
  8. Federated Learning for NLP in Southeast Asia: Challenges and OpportunitiesGap: Federated NLP for low-resource SEA languages lacks a dedicated survey.
  9. XAI for Text Classification: A Survey of Explanation Methods for BERT and BeyondGap: Explainable BERT (Tirana 2026 query) for text classification; no survey comprehensively covers XAI for BERT.
  10. Clustering Algorithms for Cybersecurity Log Analysis: A Survey and BenchmarkGap: HDBSCAN for cyber (UB 2026) motivates a broader survey of clustering methods for security logs.