Понемногу тестирую свой новый мегатест. К сожалению, по причине крайне низкой производительности хоста с бд, в массы пустить его пока не могу. Повышаю скорость за счёт точности. Ужасно жалко, но пока ничего не могу придумать. Идея теста проста как валенок. Берём базу всех произведений с lib.ru. Строим частотный словарь с учётом словоформ. Берём такой же частотный словарь произвольного блога. Считаем совпадения по частоте слов там и там, делаем список произведений по попаданиям в частоту. Сортируем, любуемся результатом. И вот вроде частотный словарь не так велик получился - 1,6 млн записей, да, видно, со структурой базы промахнулся. Или в днк у меня ошибка. Или комп небыстрый. Но как-то это всё пока совершенно неудовлетворительно работает. У меня даже комплекс неполноценности развился. Завтра попробую физически базу перекинуть на RAID-массив уровня 6 вместо одиночного винча - вдруг поможет. А пока можно посмотреть под катом, что оно про меня выдало (вариант не окончательный, it depends of)
Предложения по структуре табличек и оптимизации принимаются.
PS. Пока писал пост, подумал, что одним из выходов может быть запихивание всей таблицы в оперативку, т.е. MyISAM = > memory. Только это тупо и полгига памяти ужрёт.
