【问题标题】:strcmp ignoring accents, outputs falsestrcmp 忽略重音,输出 false
【发布时间】:2018-01-15 16:53:16
【问题描述】:

我有几个 strcmp 来获取布尔值,它们都可以正常工作,除非字符串包含重音符号。

if(strcmp(arrayOfStrings[index], "Día de descanso") == 0

输出假而不是真。我一直在尝试使用转义序列进行比较,但我无法使其工作。

使用下一个函数将字符串添加到 arrayOfStrings:

void introducirPlan()
{
  for(int i = 1; i <= 10; i++)
  {
    printf("Actividad del dia %d? ", i);
    scanf(" %[^\n]", diasEntrenamiento[i]);
  }
  printf("\n");
}

还有另一个函数只是检查使用 strcmp 添加的字符串:

bool compararDescanso(int idia)
{
  if(strcmp(diasEntrenamiento[idia], "Día de descanso") == 0)
  {
    return true;
  }
  if(strcmp(diasEntrenamiento[idia], "Dia de descanso") == 0)
  {
    return true;
  }
}

这里好像 strcmp 输出 false:

  while(cntImprEntr <= 10)
  {
    if(compararDescanso(cntImprEntr) == true)
    {
      printf(" D "); /*"D" never gets printed if string contains accent */
      columna++;
      dia++;
    }
    else
    {
      printf(" C ");
      columna++;
      dia++;
    }
    if(columna == 5)
    {
      printf("|");
    }
    printf(" ");
    cntImprEntr++;
    if(columna >= 7)
    {
      printf("\n");
      columna = 0;
    }
  }

有什么方法可以让 strcmp 不忽略重音并给出真实的输出?当索引内的字符串包含“Dia”而不是“Día”时,它可以正常工作。 谢谢

【问题讨论】:

  • 试试 unicode 字符串。
  • minimal reproducible example 是必需的。我们不知道您的数组包含什么。
  • 问题是,当比较的字符串正好是上面所说的“Día”时,strcmp 仍然输出 false。数组的其余部分包含随机字符串。
  • 我们需要用minimal reproducible example 来证明它,正如已经问过的那样。没有它,问题很快就会结束。
  • A minimal reproducible example 本身可能还不够,因为还涉及其他因素,例如程序的源和执行字符编码,以及程序用户输入的字符编码。源和执行字符编码可以使用编译器选项来控制。对于 GCC,那些将是 -finput-charset= 选项(用于源代码字符编码)和 -fexec-charset= 选项(用于可执行字符编码)。您可能还需要将终端设置为正确的语言环境并调用setlocale,尽管strcmp 并不关心语言环境。

标签: c string compare strcmp


【解决方案1】:

您的问题与文本编码有关。

虽然你没有说出来,但你很可能在 Windows 上工作,并使用终端来执行你的程序。

问题在于,Windows 对您的终端使用的字符编码不同于它用于“窗口化”程序(以及因此您的文本编辑器)的字符编码。

这意味着重音字符的代码是相同的。

首先要了解什么是 unicode 和字符编码:https://www.joelonsoftware.com/2003/10/08/the-absolute-minimum-every-software-developer-absolutely-positively-must-know-about-unicode-and-character-sets-no-excuses/

第二件事,只需更改文本编辑器的编码以匹配终端的编码 - 我不确定西班牙语中用于 Windows 的编码,但在葡萄牙语中,终端是 cp-852,“windowed”是 latin1 "(我敢打赌它也是西班牙语 Windows 的“latin1”)。

NB。> 虽然微软一直坚持使用 1980 年代的这些编码,但世界其他地区,包括所有 Web,都使用“utf-8”。因此,这种编码解决方法有利于您的代码工作并从中学习,但您肯定应该专注于对注定要实际投入生产的任何事物使用“utf-8”编码。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2013-01-22
    • 2016-05-05
    • 2012-06-22
    • 1970-01-01
    • 1970-01-01
    • 2015-11-28
    • 1970-01-01
    相关资源
    最近更新 更多