170 похожих чатов

Подскажите пожалуйста, куда копать) Есть задача. Надо читать файл блоками заданного

размера, делать что-то с ними (например crc посчитать) и записывать в том же порядке результат в другой файл. Надо сделать так, чтобы по максимуму использовать многопроцессорную обработку. Файл может быть больше чем оперативка.

Пока идея такова. Читать последовательно блок T*B где T = (число потоков -1), B - размер блока. Класть в очередь. Потоками брать из очереди и обрабатывать, Результат складывать в буфер, когда дочитаем до конца файла, основной поток переключиться на запись в файл и запишет туда буфер.

Отталкиваюсь от гипотезы, что чтение-запись долгие процессы. Или может есть способы читать один файл в несколько потоков и также писать? Например, как всякие download манеджеры, они как бы по частям файл качают и пишут тоже, или фикция и под капотом иначе?

Думаю моя проблема в слабом понимании работы с файлами под капотом. ОС не оговорена, так что ОС зависимые штуки не использую.

Порекомендуйте куда копнуть)

9 ответов

19 просмотров

из опыта работы с файлами в win7 - читай последовательно обычным read в буфера в одном потоке и складывай в очередь, обрабатывай в N=num_hardware_threads потоках, пиши прямо в файл, запись - это просто memcpy MMF при последовательном чтении работает чуть медленней если данных ещё нет в ОЗУ (вероятно, из-за pagefaults на каждой 4КБ странице), при непоследовательном если у тебя HDD - может быть вообще сумрак запись можно сделать в mmf, но в моём опыте винда не скидывала кеш пока не закроешь mapping. хотя это кажись ещё в xp было

ну и собственное главное. даже сделав идеальный код с MMF (а у нас пока есть только вариант для win10), ты выиграешь ровно одно memcpy. стоит ли эта экономия всех усилий - зависит от ваших задач

у меня к слову есть одна утилита, которая до нескольких гиг в сек обрабатывает в многопотоке. вот у неё есть два режима работы - через MMF и read. первый режим используется для бенчей когда файл уже загнан в кеш. а второй работает быстрее если файла в кеше ещё нет :)) это на win7 тесты

Bulat Ziganshin
у меня к слову есть одна утилита, которая до неско...

В разработке драйверов-фильтров, сканирующих содержимое файла, если негласное правило использовать преимущественно MMF, считая, что файл будет использоваться приложением не в noncached-режиме. Это может сильно повлиять на результаты бенчмарков "в полях" :)

а можно немного не по теме вопрос? при использовании noncached из юзерспейса, DMA трансферы идут прямо в пользовательский буфер?

Не совсем понял, к чему именно придирка. В статье много специфичных для фильтров вещей вроде обхода IO-стека с верхушки и т.д., но касательно конкретного вопроса - идея в том, что FsRtlCreateSectionForDataScan() создаёт секцию с довольно агресивными флагами кеширования, и поскольку пользовательские операции обычно cached/MMF, пресловутые pf либо "переедут" в kernel space (сканирование в create), либо вообще маловероятны (сканирование в close + кто-то потом откроет файл, а он уже почти весь в кэше)

Dmitriy [Отпуск]
Не совсем понял, к чему именно придирка. В статье ...

возможно для kernel space эти page faults дёшевы и в этом вся разница

Похожие вопросы

Обсуждают сегодня

Господа, а что сейчас вообще с рынком труда на делфи происходит? Какова ситуация?
Rꙮman Yankꙮvsky
29
А вообще, что может смущать в самой Julia - бы сказал, что нет единого стандартного подхода по многим моментам, поэтому многое выглядит как "хаки" и произвол. Короче говоря, с...
Viktor G.
2
30500 за редактор? )
Владимир
47
а через ESC-код ?
Alexey Kulakov
29
Гайс, вопрос для разносторонее развитых: читаю стрим с юарта, нада выделять с него фреймы с определенной структурой, если ли чо готовое, или долбаться с ринг буффером? нада у...
Vitaly
9
Чёт не понял, я ж правильной функцией воспользовался чтобы вывести отладочную информацию? но что-то она не ловится
notme
18
У меня есть функция где происходит это: write_bit(buffer, 1); write_bit(buffer, 0); write_bit(buffer, 1); write_bit(buffer, 1); write_bit(buffer, 1); w...
~
14
Добрый день! Скажите пожалуйста, а какие программы вы бы рекомендовали написать для того, чтобы научиться управлять памятью? Можно написать динамический массив, можно связный ...
Филипп
7
Недавно Google Project Zero нашёл багу в SQLite с помощью LLM, о чём достаточно было шумно в определённых интернетах, которые сопровождались рассказами, что скоро всех "ибешни...
Alex Sherbakov
5
длина пакета фиксированная, или меняется?
Okhsunrog
7
Карта сайта