The
SecureBERT 2.0 Bi-Encoder
is a cybersecurity-domain sentence-similarity and document-embedding model fine-tuned from
SecureBERT 2.0
.
It independently encodes queries and documents into a shared vector space for
semantic search
,
information retrieval
, and
cybersecurity knowledge retrieval
.
Model Details
Model Description
Developed by:
Cisco AI
Model type:
Bi-Encoder (Sentence Transformer)
Architecture:
ModernBERT backbone with dual encoders
Semantic search
and
document similarity
in cybersecurity corpora
Information retrieval
and
ranking
for threat intelligence reports, advisories, and vulnerability notes
Document embedding
for retrieval-augmented generation (RAG) and clustering
Downstream Use
Threat intelligence knowledge graph construction
Cybersecurity QA and reasoning systems
Security operations center (SOC) data mining
Out-of-Scope Use
Non-technical or general-domain text similarity
Generative or conversational tasks
Model Architecture
The Bi-Encoder encodes queries and documents
independently
into a joint vector space.
This architecture enables scalable
approximate nearest-neighbor search
for candidate retrieval and semantic ranking.
Datasets
Fine-Tuning Datasets
Dataset Category
Number of Records
Cybersecurity QA corpus
43 000
Security governance QA corpus
60 000
Cybersecurity instruction–response corpus
25 000
Cybersecurity rules corpus (evaluation)
5 000
Dataset Descriptions
Cybersecurity QA corpus:
43 k question–answer pairs, reports, and technical documents covering network security, malware analysis, cryptography, and cloud security.
Security governance QA corpus:
60 k expert-curated governance and compliance QA pairs emphasizing clear, validated responses.
Cybersecurity instruction–response corpus:
25 k instructional pairs enabling reasoning and instruction-following.
Cybersecurity rules corpus:
5 k structured policy and guideline records used for evaluation.
How to Get Started with the Model
Using Sentence Transformers
pip install -U sentence-transformers
Run Model to Encode
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("cisco-ai/SecureBERT2.0-biencoder")
sentences = [
"How would you use Amcache analysis to detect fileless malware?",
"Amcache analysis provides forensic artifacts for detecting fileless malware ...",
"To capture and display network traffic"
]
embeddings = model.encode(sentences)
print(embeddings.shape)
Compute Similarity
from sentence_transformers import util
similarity = util.cos_sim(embeddings, embeddings)
print(similarity)
Framework Versions
python: 3.10.10
sentence_transformers: 5.0.0
transformers: 4.52.4
PyTorch: 2.7.0+cu128
accelerate: 1.9.0
datasets: 3.6.0
Training Details
Training Dataset
The model was fine-tuned on cybersecurity-specific paired-sentence data for document embedding and similarity learning.
Dataset Size:
35,705 samples
Columns:
sentence_0
,
sentence_1
,
label
Example Schema
Field
Type
Description
sentence_0
string
Query or short text input
sentence_1
string
Candidate or document text
label
float
Similarity score (1.0 = relevant)
Example Samples
sentence_0
sentence_1
label
Under what circumstances does attribution bias distort intrusion linking?
Attribution bias in intrusion linking occurs when analysts allow preconceived notions, organizational pressures, or cognitive shortcuts to influence their assessment of attack origins and relationships between incidents...
1.0
How can you identify store buffer bypass speculation artifacts?
Store buffer bypass speculation artifacts represent side-channel vulnerabilities that exploit speculative execution to leak sensitive information...
1.0
Training Objective and Loss
The model was optimized to maximize semantic similarity between relevant cybersecurity text pairs using contrastive learning.
@article{aghaei2025securebert,
title={SecureBERT 2.0: Advanced Language Model for Cybersecurity Intelligence},
author={Aghaei, Ehsan and Jain, Sarthak and Arun, Prashanth and Sambamoorthy, Arjun},
journal={arXiv preprint arXiv:2510.00240},
year={2025}
}
SecureBERT2.0-biencoder huggingface.co is an AI model on huggingface.co that provides SecureBERT2.0-biencoder's model effect (), which can be used instantly with this cisco-ai SecureBERT2.0-biencoder model. huggingface.co supports a free trial of the SecureBERT2.0-biencoder model, and also provides paid use of the SecureBERT2.0-biencoder. Support call SecureBERT2.0-biencoder model through api, including Node.js, Python, http.
SecureBERT2.0-biencoder huggingface.co is an online trial and call api platform, which integrates SecureBERT2.0-biencoder's modeling effects, including api services, and provides a free online trial of SecureBERT2.0-biencoder, you can try SecureBERT2.0-biencoder online for free by clicking the link below.
cisco-ai SecureBERT2.0-biencoder online free url in huggingface.co:
SecureBERT2.0-biencoder is an open source model from GitHub that offers a free installation service, and any user can find SecureBERT2.0-biencoder on GitHub to install. At the same time, huggingface.co provides the effect of SecureBERT2.0-biencoder install, users can directly use SecureBERT2.0-biencoder installed effect in huggingface.co for debugging and trial. It also supports api for free installation.
SecureBERT2.0-biencoder install url in huggingface.co: