GenAI Foundations — Model Comparison Analysis

Module 2 Assessment | SA Enablement 2026 | Xinzhi Sherry Zhu (zhxinzhi)

1. Models Evaluated

ModelProviderInference ProfileCharacteristics
Claude Sonnet 4.6Anthropicjp.anthropic.claude-sonnet-4-6High capability, extended thinking
Nova ProAmazonapac.amazon.nova-pro-v1:0Balanced performance/cost
GPT-OSS 20BOpenAIopenai.gpt-oss-20b-1:0Cost-optimized reasoning

All models accessed via Amazon Bedrock Converse API with cross-region inference profiles.

2. Benchmark Results

Three prompt categories tested: short factual Q&A, analytical comparison, and structured summarization.

2.1 Latency (ms)

ModelShort FactualAnalyticalStructuredAverage
Claude Sonnet 4.63,18928,5195,17812,295
Nova Pro6592,3001,1401,366
GPT-OSS 20B5586,9421,5933,031

2.2 Output Tokens

ModelShort FactualAnalyticalStructured
Claude Sonnet 4.6871,713202
Nova Pro66541210
GPT-OSS 20B932,048*469

* GPT-OSS 20B hit the default max_tokens limit (2048) on the analytical prompt.

2.3 Cost per Request (USD)

ModelShort FactualAnalyticalStructuredTotal (3 calls)
Claude Sonnet 4.6$0.00137$0.02576$0.00310$0.03023
Nova Pro$0.00022$0.00174$0.00068$0.00264
GPT-OSS 20B$0.00005$0.00083$0.00020$0.00107

3. Analysis & Trade-offs

Claude Sonnet 4.6

Nova Pro

GPT-OSS 20B

4. Recommendations

For startup chat applications: Use Nova Pro as the default model (low latency, reasonable cost), offer Claude Sonnet 4.6 as a premium option for complex tasks, and use GPT-OSS 20B for background/batch operations where cost dominates.

Decision Matrix

PriorityRecommended ModelRationale
Quality firstClaude Sonnet 4.6Superior reasoning, best for customer-facing
Latency firstNova ProSub-second for short queries, consistent
Cost firstGPT-OSS 20B28x cheaper than Claude, acceptable quality
BalancedNova ProBest latency/cost ratio for interactive use