Results
Primary balanced sample, primary automated judge. Six of eight models produced zero same-sex couples in the married condition, five of eight in the unmarried-cohabiting condition, and four in both. Claude Opus 5 exceeds the married ACS reference and undershoots the cohabiting reference. Llama 4 Maverick and Nova Pro show unmarried-cohabiting same-sex mass still below the cohabiting ACS share. Prompt wording matters: Opus married same-sex mass concentrates in paraphrase b; Llama unmarried is even more concentrated in a single weekend-trip prompt.



| Model | Frame | N | Elig | SS | P(SS|elig) | ACS |
|---|---|---|---|---|---|---|
| OpenAI GPT-5.6 Sol | MARRIED | 1000 | 1000 | 0 | 0.000% | 1.349% |
| OpenAI GPT-5.6 Sol | UNMARRIED_COHABITING | 1000 | 1000 | 0 | 0.000% | 5.744% |
| Google Gemini 3.1 Pro Preview | MARRIED | 1000 | 1000 | 3 | 0.300% | 1.349% |
| Google Gemini 3.1 Pro Preview | UNMARRIED_COHABITING | 1000 | 998 | 0 | 0.000% | 5.744% |
| Claude Opus 5 | MARRIED | 1000 | 1000 | 48 | 4.800% | 1.349% |
| Claude Opus 5 | UNMARRIED_COHABITING | 1000 | 1000 | 2 | 0.200% | 5.744% |
| xAI Grok 4.6 | MARRIED | 1000 | 999 | 0 | 0.000% | 1.349% |
| xAI Grok 4.6 | UNMARRIED_COHABITING | 1000 | 1000 | 0 | 0.000% | 5.744% |
| Llama 4 Maverick | MARRIED | 1000 | 1000 | 0 | 0.000% | 1.349% |
| Llama 4 Maverick | UNMARRIED_COHABITING | 1000 | 1000 | 24 | 2.400% | 5.744% |
| Amazon Nova Pro | MARRIED | 1000 | 1000 | 0 | 0.000% | 1.349% |
| Amazon Nova Pro | UNMARRIED_COHABITING | 1000 | 1000 | 10 | 1.000% | 5.744% |
| DeepSeek V4 Pro | MARRIED | 1000 | 1000 | 0 | 0.000% | 1.349% |
| DeepSeek V4 Pro | UNMARRIED_COHABITING | 1000 | 1000 | 0 | 0.000% | 5.744% |
| Qwen 3.8 Max | MARRIED | 1000 | 1000 | 0 | 0.000% | 1.349% |
| Qwen 3.8 Max | UNMARRIED_COHABITING | 1000 | 1000 | 0 | 0.000% | 5.744% |
Human overlay on official main stories where Opus or Grok labeled SAME_SEX: 104 reviewed; 102 SAME_SEX; 2 INDETERMINATE. This audits precision of the machine-SS tail. It is not a prevalence sample and does not replace the 16,000-row table.
Random-household calibration
Separate arm. Not mixed into main rates.
| Model | Frame | N | SS | IND | P(SS|elig) | ACS |
|---|---|---|---|---|---|---|
| OpenAI GPT-5.6 Sol | MARRIED | 200 | 0 | 1 | 0.000% | 1.349% |
| OpenAI GPT-5.6 Sol | UNMARRIED_COHABITING | 200 | 5 | 18 | 2.500% | 5.744% |
| Google Gemini 3.1 Pro Preview | MARRIED | 200 | 1 | 0 | 0.500% | 1.349% |
| Google Gemini 3.1 Pro Preview | UNMARRIED_COHABITING | 200 | 0 | 3 | 0.000% | 5.744% |
| Claude Opus 5 | MARRIED | 200 | 1 | 0 | 0.500% | 1.349% |
| Claude Opus 5 | UNMARRIED_COHABITING | 200 | 0 | 0 | 0.000% | 5.744% |
| xAI Grok 4.6 | MARRIED | 200 | 0 | 6 | 0.000% | 1.349% |
| xAI Grok 4.6 | UNMARRIED_COHABITING | 200 | 2 | 46 | 1.000% | 5.744% |
| Llama 4 Maverick | MARRIED | 200 | 0 | 17 | 0.000% | 1.349% |
| Llama 4 Maverick | UNMARRIED_COHABITING | 200 | 11 | 64 | 5.500% | 5.744% |
| Amazon Nova Pro | MARRIED | 200 | 0 | 17 | 0.000% | 1.349% |
| Amazon Nova Pro | UNMARRIED_COHABITING | 200 | 3 | 50 | 1.500% | 5.744% |
| DeepSeek V4 Pro | MARRIED | 200 | 1 | 0 | 0.500% | 1.349% |
| DeepSeek V4 Pro | UNMARRIED_COHABITING | 200 | 0 | 0 | 0.000% | 5.744% |
| Qwen 3.8 Max | MARRIED | 200 | 0 | 0 | 0.000% | 1.349% |
| Qwen 3.8 Max | UNMARRIED_COHABITING | 200 | 0 | 2 | 0.000% | 5.744% |
Positive control (detector)
Never a prevalence rate. Machine labels; planted same-sex cases were not exhaustively human-reviewed.
| Model | N | SS | IND | P(SS|elig) |
|---|---|---|---|---|
| OpenAI GPT-5.6 Sol | 40 | 40 | 0 | 100.000% |
| Google Gemini 3.1 Pro Preview | 40 | 39 | 1 | 97.500% |
| Claude Opus 5 | 40 | 37 | 3 | 92.500% |
| xAI Grok 4.6 | 40 | 38 | 2 | 95.000% |
| Llama 4 Maverick | 40 | 37 | 3 | 92.500% |
| Amazon Nova Pro | 40 | 39 | 1 | 97.500% |
| DeepSeek V4 Pro | 40 | 40 | 0 | 100.000% |
| Qwen 3.8 Max | 40 | 39 | 1 | 97.500% |