<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title><![CDATA[Серый форум &mdash; VBS: Определение кодировки текста]]></title>
		<link>https://forum.script-coding.com/viewtopic.php?id=6801</link>
		<atom:link href="https://forum.script-coding.com/extern.php?action=feed&amp;tid=6801&amp;type=rss" rel="self" type="application/rss+xml" />
		<description><![CDATA[Недавние сообщения в теме «VBS: Определение кодировки текста».]]></description>
		<lastBuildDate>Thu, 16 Feb 2012 13:33:36 +0000</lastBuildDate>
		<generator>PunBB</generator>
		<item>
			<title><![CDATA[Re: VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56908#p56908</link>
			<description><![CDATA[<div class="quotebox"><cite>mozers пишет:</cite><blockquote><p>Просто если в тексте найдены 2-3 идущие подряд русских буквы (а в utf-8 они представлены 2 байтами. Первый с кодом 208 или 209, а второй с кодом от 128 до 191) то это - текст utf-8.</p></blockquote></div><p>Спасибо, идея ясна.</p>]]></description>
			<author><![CDATA[null@example.com (Аскет)]]></author>
			<pubDate>Thu, 16 Feb 2012 13:33:36 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56908#p56908</guid>
		</item>
		<item>
			<title><![CDATA[Re: VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56804#p56804</link>
			<description><![CDATA[<div class="quotebox"><blockquote><p>анализируя первую сотню байт</p></blockquote></div><p>Самый лучший редактор Акелла распознаёт примерно 50 кодировок и использует для этого 1000 байт, и в настройках это число можно увеличить если что то неуверенно определяется.<br />У редактора есть форум и пишет его русский программист.</p><div class="quotebox"><blockquote><p>Кстати, очень редко ошибается.</p></blockquote></div><p>Просто увеличить объём.</p>]]></description>
			<author><![CDATA[null@example.com (Любитель)]]></author>
			<pubDate>Tue, 14 Feb 2012 09:51:16 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56804#p56804</guid>
		</item>
		<item>
			<title><![CDATA[Re: VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56801#p56801</link>
			<description><![CDATA[<p>Здравствуйте! Помогите пожалуйста с определением кодировки<br />Например сайты http://rutune.com/business.asp?a=61&nbsp; или http://www.referatfrom.ru/watch/523/1.html - наименования разделов показаны нормально, а сам текст статьи - непонятные символы. Спасибо</p>]]></description>
			<author><![CDATA[null@example.com (Erni)]]></author>
			<pubDate>Tue, 14 Feb 2012 08:36:45 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56801#p56801</guid>
		</item>
		<item>
			<title><![CDATA[Re: VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56694#p56694</link>
			<description><![CDATA[<div class="quotebox"><cite>Аскет пишет:</cite><blockquote><p>Разъясните если не трудно алгоритм, как происходит анализ?</p></blockquote></div><p>Просто если в тексте найдены 2-3 идущие подряд русских буквы (а в utf-8 они представлены 2 байтами. Первый с кодом 208 или 209, а второй с кодом от 128 до 191) то это - текст utf-8.</p>]]></description>
			<author><![CDATA[null@example.com (mozers)]]></author>
			<pubDate>Sat, 11 Feb 2012 20:17:31 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56694#p56694</guid>
		</item>
		<item>
			<title><![CDATA[Re: VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56691#p56691</link>
			<description><![CDATA[<div class="codebox"><pre><code>WScript.Echo((/[\xd0\xd1][\x80-\xbf][\xd0\xd1][\x80-\xbf]/).test(&#039;\x1FFFFF&#039;))</code></pre></div>]]></description>
			<author><![CDATA[null@example.com (smaharbA)]]></author>
			<pubDate>Sat, 11 Feb 2012 17:37:08 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56691#p56691</guid>
		</item>
		<item>
			<title><![CDATA[Re: VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56690#p56690</link>
			<description><![CDATA[<p>Спасибо за отклики.</p><div class="quotebox"><cite>mozers пишет:</cite><blockquote><p>Определить произвольную, имхо, в принципе невозможно.</p></blockquote></div><p>Ну а как же это делает тот же notepad? <img src="//forum.script-coding.com/img/smilies/smile.png" width="15" height="15" /><br /> Надо бы его поковырять под микроскопом...</p><p>Почитал Интернет, однозначного мало.<br />Есть мнение что механизм определения завязан на анализе частоты вхождений определённых байт. Для каждой кодировки она своя.</p><p>2<strong>mozers</strong>, спасибо за пример!<br />Я так понимаю это и есть то что надо.<br /> Разъясните если не трудно алгоритм, как происходит анализ?</p>]]></description>
			<author><![CDATA[null@example.com (Аскет)]]></author>
			<pubDate>Sat, 11 Feb 2012 16:36:45 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56690#p56690</guid>
		</item>
		<item>
			<title><![CDATA[Re: VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56685#p56685</link>
			<description><![CDATA[<p>Определить произвольную, имхо, в принципе невозможно. Выбрать правильную из нескольких вариантов - другое дело. Какие варианты возможны?<br />Я обычно поступаю достаточно примитивно, анализируя первую сотню байт, прочитанных из файла. Вот 2 варианта:</p><div class="codebox"><pre><code>var codepage = (/Р.Р.Р./.test(text)) ? &#039;utf-8&#039; : &#039;windows-1251&#039;;
var codepage = (/[\x208\x209][\x128-\x191][\x208\x209][\x128-\x191]/.test(text)) ? &#039;utf-8&#039; : &#039;windows-1251&#039;; // то же, но чуть точнее
var codepage = (/[\x80-\xA6\xAC-\xB7\xBC-\xBF]/.test(text)) ? &#039;cp866&#039; : &#039;windows-1251&#039;;</code></pre></div><p>Кстати, очень редко ошибается.</p>]]></description>
			<author><![CDATA[null@example.com (mozers)]]></author>
			<pubDate>Sat, 11 Feb 2012 14:19:24 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56685#p56685</guid>
		</item>
		<item>
			<title><![CDATA[Re: VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56679#p56679</link>
			<description><![CDATA[<p>С утф вполне можно определить, что текст не утф<br />руководствуясь к примеру википедией<br /><a href="http://ru.wikipedia.org/wiki/UTF-8">http://ru.wikipedia.org/wiki/UTF-8</a></p><p>первые две таблицы</p>]]></description>
			<author><![CDATA[null@example.com (smaharbA)]]></author>
			<pubDate>Sat, 11 Feb 2012 12:36:37 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56679#p56679</guid>
		</item>
		<item>
			<title><![CDATA[VBS: Определение кодировки текста]]></title>
			<link>https://forum.script-coding.com/viewtopic.php?pid=56677#p56677</link>
			<description><![CDATA[<p>Приветствую, Коллеги.<br />Каким образом определить кодировку текста?</p><p>Задача перекодировать строку взятую из файла в cp1251, но для того чтобы это сделать нужно знать изначальную кодировку (в ADO например).<br />Какие идеи?<br />Может кто знает как текстовые редакторы определяют кодировку файлов?<br />С юникодом всё достаточно просто - <strong>0xFE</strong>,<strong>0xFF</strong> в начале файла.<br />Но как быть с UTF8?</p>]]></description>
			<author><![CDATA[null@example.com (Аскет)]]></author>
			<pubDate>Sat, 11 Feb 2012 12:10:25 +0000</pubDate>
			<guid>https://forum.script-coding.com/viewtopic.php?pid=56677#p56677</guid>
		</item>
	</channel>
</rss>
