170 похожих чатов

Подскажите пожалуйста, куда копать) Есть задача. Надо читать файл блоками заданного

размера, делать что-то с ними (например crc посчитать) и записывать в том же порядке результат в другой файл. Надо сделать так, чтобы по максимуму использовать многопроцессорную обработку. Файл может быть больше чем оперативка.

Пока идея такова. Читать последовательно блок T*B где T = (число потоков -1), B - размер блока. Класть в очередь. Потоками брать из очереди и обрабатывать, Результат складывать в буфер, когда дочитаем до конца файла, основной поток переключиться на запись в файл и запишет туда буфер.

Отталкиваюсь от гипотезы, что чтение-запись долгие процессы. Или может есть способы читать один файл в несколько потоков и также писать? Например, как всякие download манеджеры, они как бы по частям файл качают и пишут тоже, или фикция и под капотом иначе?

Думаю моя проблема в слабом понимании работы с файлами под капотом. ОС не оговорена, так что ОС зависимые штуки не использую.

Порекомендуйте куда копнуть)

9 ответов

11 просмотров

из опыта работы с файлами в win7 - читай последовательно обычным read в буфера в одном потоке и складывай в очередь, обрабатывай в N=num_hardware_threads потоках, пиши прямо в файл, запись - это просто memcpy MMF при последовательном чтении работает чуть медленней если данных ещё нет в ОЗУ (вероятно, из-за pagefaults на каждой 4КБ странице), при непоследовательном если у тебя HDD - может быть вообще сумрак запись можно сделать в mmf, но в моём опыте винда не скидывала кеш пока не закроешь mapping. хотя это кажись ещё в xp было

ну и собственное главное. даже сделав идеальный код с MMF (а у нас пока есть только вариант для win10), ты выиграешь ровно одно memcpy. стоит ли эта экономия всех усилий - зависит от ваших задач

у меня к слову есть одна утилита, которая до нескольких гиг в сек обрабатывает в многопотоке. вот у неё есть два режима работы - через MMF и read. первый режим используется для бенчей когда файл уже загнан в кеш. а второй работает быстрее если файла в кеше ещё нет :)) это на win7 тесты

Bulat Ziganshin
у меня к слову есть одна утилита, которая до неско...

В разработке драйверов-фильтров, сканирующих содержимое файла, если негласное правило использовать преимущественно MMF, считая, что файл будет использоваться приложением не в noncached-режиме. Это может сильно повлиять на результаты бенчмарков "в полях" :)

а можно немного не по теме вопрос? при использовании noncached из юзерспейса, DMA трансферы идут прямо в пользовательский буфер?

Не совсем понял, к чему именно придирка. В статье много специфичных для фильтров вещей вроде обхода IO-стека с верхушки и т.д., но касательно конкретного вопроса - идея в том, что FsRtlCreateSectionForDataScan() создаёт секцию с довольно агресивными флагами кеширования, и поскольку пользовательские операции обычно cached/MMF, пресловутые pf либо "переедут" в kernel space (сканирование в create), либо вообще маловероятны (сканирование в close + кто-то потом откроет файл, а он уже почти весь в кэше)

Dmitriy [Отпуск]
Не совсем понял, к чему именно придирка. В статье ...

возможно для kernel space эти page faults дёшевы и в этом вся разница

Похожие вопросы

Обсуждают сегодня

Какой-то там пердун в 90-х решил, что есть какая-то разная типизация. Кого вообще это волнует?
КТ315
49
void terminal_scroll() { memmove(terminal_buffer, terminal_buffer + VGA_WIDTH, buffer_size - VGA_WIDTH); memset(terminal_buffer + buffer_size - VGA_WIDTH, 0, VGA_WIDTH); ...
Егор
47
Всем привет! Подскажите, пожалуйста, в чем ошибка? Настраиваю подключение к MySQL. Либы лежат рядом с exe. Все как по "учебнику"
Евгений
16
А можете как-то проверить меня по знаниям по ассемблеру?
A A
132
Здравствуйте! У меня появилась возможность купить книгу "Изучай Haskell во имя добра!". Но я где-то слышал, что эта книга устарела. Насколько это правда??
E
22
Здравствуйте! Я вот на stepic решаю задачи на хаскеле https://stepik.org/lesson/8443/step/8?unit=1578 мой код import Data.List (isInfixOf) removing :: String -> [String] ->...
E
10
Камрады, кто тесно работал с vtv, хотел уточнить. Ширина column задаётся жёстко на этапе создания дерева или можно в рантайме ее менять программно (не мышкой)?
Ed Doc
10
да ладно ... что там неочевидного ? глянуть в исх-ки датасета и/или кверика чтобы понять в каком месте и как выполняется обращения к св-вам blablaSQL - минутное дело, даже е...
Сергей
7
Здесь для arm кто-нибудь кодит ?
Nothing
52
Всем привет, у меня есть сервер принимающий входящие HTTP подключения, как проверить, что подключение было через прокси или нет, есть какие то поля в заголовках по которым мо...
Кибер Бомж
8
Карта сайта