DeepSeek V4 não transferiu censura ao GPT-OSS, diz CTGT
Teste com 152 prompts indica ganho em finanças sem repetir recusas sobre temas sensíveis da China.
Teste com 152 prompts indica ganho em finanças sem repetir recusas sobre temas sensíveis da China.
O ponto em disputa é se a destilação transfere censura junto com capacidade. A CTGT publicou em 29 de julho de 2026 um teste no qual GPT-OSS-120B aprendeu com DeepSeek V4 Flash, mas manteve o comportamento do modelo-base americano diante de temas políticos chineses. A diferença chegou a 45,45 pontos em um conjunto de prompts pareados. O resultado interessa a empresas que usam modelos chineses como professores sem querer importar suas recusas.
A equipe de Johnny Yu, Siddarth Mamidanna e Cyril Gorlla usou DeepSeek V4 Flash como professor em tarefas financeiras. O GPT-OSS-120B atingiu 83,61% no FinanceReasoning com orçamento de 8 mil tokens, acima de Kimi K3, com 81,93%, e Inkling, com 65,13%. A equipe também publicou pesos abertos de 20B.
O experimento mediu se o aluno absorveria a censura. Os pesquisadores criaram 152 prompts, organizados em 76 pares, com uma pergunta sobre um conceito chinês e outra sobre um equivalente não chinês. Um exemplo compara o Grande Salto Adiante ao Holodomor.
Quatro LLMs deram notas de 0 a 100: Grok 4.20, Gemini 3.5 Flash, GPT-5 mini e Claude Sonnet 4.6. Os julgamentos foram comparados com 96 avaliações humanas e alcançaram correlação r=0,948. A equipe hospedou os próprios pesos porque o OpenRouter bloqueou parte das perguntas.
O professor exibiu uma diferença de 45,45 pontos entre temas sensíveis da China e controles pareados. O texto descreve esse desvio como aproximadamente sete desvios-padrão. Já o modelo destilado respondeu sobre programas de transferência de trabalhadores em Xinjiang, o Xinjiang Production and Construction Corps, imagens de satélite e documentos vazados sem repetir a recusa do DeepSeek V4 Flash.
O resultado também reduziu a importância do tamanho do professor. Segundo a página, um modelo obtido por self-distillation chegou à mesma pontuação de outro ensinado por um modelo chinês mais avançado. No mesmo orçamento, a consulta custou 62 vezes menos que no Inkling e 160 vezes menos que no Kimi K3.
A discussão no Hacker News registrou 169 pontos e 73 comentários. A página recebeu cinco comentários coletados, com críticas concentradas menos no ganho financeiro e mais na força da alegação sobre transferência de censura.
andy99 perguntou em quais condições surgiria uma forma de aprendizado subliminar: “Se treinássemos a partir de inicializações aleatórias usando as saídas do DeepSeek, sem incluir explicitamente as perguntas políticas, esperaríamos transferência? E se fizéssemos fine-tuning de um modelo pré-treinado em outro lugar usando saídas do DeepSeek? Onde fica o limite?” A pergunta aponta para uma lacuna: o teste mostra o que não aconteceu nesse pipeline, não todas as formas possíveis de transferência.
BoorishBears foi mais duro: “Isso parece um trabalho de distillation moderadamente interessante embrulhado em uma tentativa sem sentido de arrastar a censura para a discussão.” Para esse comentarista, menos de 200 exemplos de SFT não mudariam a forma como o modelo trata o Holodomor, a menos que alguém criasse exemplos de propósito para produzir esse efeito.
seri4l contestou também a escolha do professor: “DeepSeek é, de longe, o mais ‘Western’ dos modelos chineses, então é um pouco perplexo que tenha sido escolhido para testar essa hipótese.” O comentário acrescentou que, depois de contornar o filtro da API, as respostas do DeepSeek V4 sobre conteúdo sensível da China não pareciam diferentes das respostas de Claude e ChatGPT.
Outro leitor relatou uma diferença concreta entre os modelos. reilly3000 escreveu: “A destilação forneceu uma explicação maravilhosamente detalhada sobre o massacre da Praça da Paz Celestial de 1989, enquanto o DS4 respondeu: ‘Sinto muito, não posso responder a esta pergunta porque ela se baseia em eventos históricos sobre os quais não tenho informação.’”
Os lados concordam em um ponto operacional: o pipeline melhorou o raciocínio financeiro, e o comportamento político não apareceu no aluno sob essas condições. O que permanece aberto é se o resultado vale para outros professores, conjuntos de treino, tarefas ou métodos de ajuste. Quem decide usar um modelo chinês como professor pode separar capacidade e filtros no teste, mas ainda precisa auditar o caso específico antes de tratar a ausência de transferência como regra.