GPT-5.6 (Sol / Terra / Luna) is now evaluated on TrustVector โ€” with day-1 independent verification, incl. METR's benchmark-cheating findings.

Read the evaluation
Evaluation record ยท openai-o3-mini

OpenAI o3-mini

v20251201

OpenAI

Modeldeprecatedreasoningcode-generationmini-model
87
Strong
About This Model

DEPRECATED: o3-mini's API shuts down 2026-10-23; migration target is GPT-5.5. Historically an efficient reasoning model from OpenAI achieving 50% on SWE-bench and 87.3% on HumanEval, optimized for fast reasoning at competitive pricing with strong coding capabilities.

Last Evaluated: July 9, 2026
Official Website

Trust Vector Analysis

Dimension Breakdown

๐Ÿš€Performance & Reliability
+

Strong performance with efficient reasoning. Excellent HumanEval at 87.3% with fast latency.

task accuracy code

Industry-standard coding benchmarks

Evidence
SWE-bench Verified โ€” 50% resolution rate
HumanEval โ€” 87.3% accuracy on code generation
highVerified: 2026-07-09
task accuracy reasoning

Competition-level reasoning benchmarks

Evidence
AIME 2024 โ€” 62% on competition math
highVerified: 2026-07-09
task accuracy general

Comprehensive knowledge testing

Evidence
MMLU โ€” 75.8% on comprehensive knowledge
highVerified: 2026-07-09
output consistency

Internal testing

Evidence
OpenAI Documentation โ€” Good consistency with efficient reasoning
highVerified: 2026-07-09
latency p50

Median latency

Evidence
OpenAI Documentation โ€” Fast response time ~1.8s
highVerified: 2026-07-09
latency p95

95th percentile

Evidence
Community benchmarking โ€” p95 latency ~3.2s
highVerified: 2026-07-09
context window

Official specification

Evidence
OpenAI Documentation โ€” 128K tokens
highVerified: 2026-07-09
uptime

Historical data

Evidence
OpenAI Status โ€” 99.9% uptime
highVerified: 2026-07-09
๐Ÿ›ก๏ธSecurity
+

Good security with reasoning-enhanced safety.

prompt injection resistance

OWASP LLM01 testing

Evidence
OpenAI Safety โ€” Strong resistance
highVerified: 2026-07-09
jailbreak resistance

Adversarial testing

Evidence
OpenAI Safety โ€” Good jailbreak resistance
highVerified: 2026-07-09
data leakage prevention

Policy analysis

Evidence
OpenAI Privacy โ€” Standard practices
mediumVerified: 2026-07-09
output safety

Safety testing

Evidence
OpenAI Safety โ€” Comprehensive filtering
highVerified: 2026-07-09
api security

Security review

Evidence
OpenAI API โ€” Enterprise security
highVerified: 2026-07-09
๐Ÿ”’Privacy & Compliance
+

Good privacy with SOC 2. 30-day retention minimum.

data residency

Documentation review

Evidence
OpenAI Enterprise โ€” US-based
highVerified: 2026-07-09
training data optout

Policy analysis

Evidence
OpenAI Privacy โ€” No API training by default
highVerified: 2026-07-09
data retention

Policy review

Evidence
OpenAI Policies โ€” 30-day retention
highVerified: 2026-07-09
pii handling

Documentation review

Evidence
OpenAI Documentation โ€” Customer responsible
mediumVerified: 2026-07-09
compliance certifications

Certification verification

Evidence
OpenAI Trust โ€” SOC 2, GDPR
highVerified: 2026-07-09
zero data retention

Policy review

Evidence
OpenAI Enterprise โ€” 30-day minimum
mediumVerified: 2026-07-09
๐Ÿ‘๏ธTrust & Transparency
+

Good transparency with visible reasoning. Strong safety guardrails.

explainability

Feature evaluation

Evidence
Chain-of-Thought โ€” Visible reasoning
highVerified: 2026-07-09
hallucination rate

QA testing

Evidence
OpenAI Benchmarks โ€” Reduced via reasoning
highVerified: 2026-07-09
bias fairness

Bias testing

Evidence
OpenAI Safety โ€” Ongoing mitigation
mediumVerified: 2026-07-09
uncertainty quantification

Confidence assessment

Evidence
Model Behavior โ€” Good expression
highVerified: 2026-07-09
model card quality

Documentation review

Evidence
OpenAI Docs โ€” Comprehensive docs
highVerified: 2026-07-09
training data transparency

Disclosure review

Evidence
OpenAI Research โ€” General description
mediumVerified: 2026-07-09
guardrails

Safety analysis

Evidence
OpenAI Safety โ€” Comprehensive guardrails
highVerified: 2026-07-09
โš™๏ธOperational Excellence
+

Deprecated: o3-mini API shutdown scheduled 2026-10-23, migration target GPT-5.5. Versioning and ecosystem scores reduced to reflect deprecation.

api design quality

API review

Evidence
OpenAI API โ€” Well-designed
highVerified: 2026-07-09
sdk quality

SDK review

Evidence
OpenAI SDKs โ€” High-quality
highVerified: 2026-07-09
versioning policy

Policy review

Evidence
OpenAI Versioning โ€” Clear policy
OpenAI Deprecations โ€” o3-mini-2025-01-31 / o3-mini shutdown 2026-10-23; recommended replacement gpt-5.5
highVerified: 2026-07-09
monitoring observability

Tool review

Evidence
OpenAI Platform โ€” Good dashboard
highVerified: 2026-07-09
support quality

Support assessment

Evidence
OpenAI Support โ€” Good support
highVerified: 2026-07-09
ecosystem maturity

Ecosystem analysis

Evidence
OpenAI Ecosystem โ€” Mature
highVerified: 2026-07-09
license terms

Terms review

Evidence
OpenAI Terms โ€” Standard commercial
highVerified: 2026-07-09
Strengths
  • +Strong HumanEval performance (87.3%)
  • +Fast latency (1.8s p50) for a reasoning model
  • +Good value with reasoning at mini pricing
  • +Visible chain-of-thought reasoning
  • +Strong mathematical capabilities
  • +Comprehensive safety guardrails
Limitations
  • !30-day data retention (not ephemeral)
  • !Not HIPAA eligible by default
  • !Lower than o4-mini on some benchmarks
  • !Mini model limitations for complex reasoning
  • !Reasoning overhead for simple tasks
  • !Moderate general knowledge (75.8% MMLU)
  • !DEPRECATED: o3-mini API shutdown 2026-10-23 โ€” migrate to GPT-5.5
Metadata
pricing
input: $1.10 per 1M tokens
output: $4.40 per 1M tokens
notes: Budget-friendly reasoning model pricing (standard tier; reasoning tokens billed as output). Pricing applies until API shutdown 2026-10-23.
last verified: 2026-07-09
context window: 128000
languages
0: English
1: Spanish
2: French
3: German
4: Italian
5: Portuguese
6: Japanese
7: Korean
8: Chinese
modalities
0: text
api endpoint: https://api.openai.com/v1/chat/completions
open source: false
architecture: Transformer-based with efficient chain-of-thought
parameters: Not disclosed

Use Case Ratings

code generation

Strong coding with 87.3% HumanEval. Fast latency great for development workflows.

customer support

Good but reasoning may add latency. Better for complex support.

content creation

Adequate but reasoning may be unnecessary for creative tasks.

data analysis

Strong analytical capabilities with efficient reasoning.

research assistant

Good research with visible reasoning at affordable pricing.

legal compliance

Good reasoning but 30-day retention may be concern.

healthcare

Not HIPAA eligible by default.

financial analysis

Strong analytical capabilities at reasonable pricing.

education

Excellent for education with visible reasoning and good value.

creative writing

Adequate but reasoning may hinder creativity.