ny_quant: (Default)
[personal profile] ny_quant
Будь проклят тот день, когда я сел за баранку этого пылесоса! (с)

Я уже не буду говорить по сотому разу про семантику питона, индентацию и неудобный дебаггер. Самая феноменальная черта питона это непредсказуемое поведение, когда буквально один и тот же (скопипащенный) код в одном месте работает, а в другом нет, и понять в чем дело нельзя от слова никак. Сегодня у меня выдался особенно интересный день, в том смысле, что удалось наступить на одни и те же грабли дважды. Причем второй раз обошлось даже без копипасты, а прямо в одном и том же месте в цикле. Жил да был один dataframe, никого не трогал, починял примус. В одном месте к нему применялась операция groupby. И все шло хорошо пока я не поменял один из параметров, которые контролируют процесс наполнения этого dataframe. И вдруг ни с того ни с сего привет из черного ящика:

File "C:\Users\...\AppData\Local\Programs\Python\Python38\lib\site-packages\pandas\core\groupby\groupby.py", line 747, in get_group
raise KeyError(name)

Что-то где-то пошло не так, очевидно гораздо раньше, чем случилась ошибка. Дай думаю выведу данные на экран - может пойму в чем дело. Код выглядел так:

print(pos)
positions = pos.groupby(by='sign')
print(positions)
longs = positions.get_group(1)

Цикл этот проработал очень много раз без проблем. На предыдущей перед обломом итерации напечаталось:

... ......exdate ......strike. sign
619 20170616.0 2200.0 1.0
620 20170616.0 2200.0 1.0
<много похожих строк>
792 20170421.0 2475.0 -1.0
793 20170421.0 2475.0 -1.0

pandas.core.groupby.generic.DataFrameGroupBy object at 0x000001DB90D0A760

(Точки я добавил в тело поста, чтобы подравнять заголовки колонок.) А в последний раз вот что:

... ......exdate ......strike. sign
619 20170616.0 2200.0 1.0
620 20170616.0 2200.0 1.0
<много похожих строк>
817 20170616.0 2445.0 -1.0
818 20170616.0 2445.0 -1.0

Empty DataFrame
Columns: [exdate, strike, sign]
Index: []

Empty DataFrame, вон оно как! Понятно теперь почему оттуда ничего нельзя вынуть и оно ломается. Но почему оно пустое??!! Колонка 'sign' есть? Есть. Числа в ней есть? Есть, причем в каждой строчке. Так какого же черта??? И что вообще люди делают в таких случаях? Идти дебаггером в библиотеку и искать почему оно ломается в groupby.py?

Пока что я схитрил и вместо

positions = pos.groupby(by='sign')
longs = positions.get_group(1)

написал

longs = pos[pos['sign'] > 0]

Это отлично сработало, причем для тех параметров, при которых groupby() работал без аварии, результаты получились идентичные. Это, конечно, хорошо, но не покидает ощущение, что ходишь по минному полю как ночью по тайге. Хотелось бы все же по ходу чему-то научиться и что-то понять. Особенно как искать черную кошку в темной комнате.

В комментарии особенно приглашается добродетельный юзер [livejournal.com profile] laoxia, который научил меня первым шагам с dataframe, а также все кто умеет питонить, особенно [livejournal.com profile] nefedor. Также я думаю, что скорее всего разбираются в теме [livejournal.com profile] misha_b и [livejournal.com profile] kobak. Извините если отвлек от важных дел.

Date: 2022-06-30 02:59 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
Спасибо. А как там с отладчиком?

Date: 2022-06-30 03:03 pm (UTC)
From: [identity profile] Алексей Орлов (from livejournal.com)
Как нельзя лучше.

Date: 2022-06-30 03:09 pm (UTC)
From: [identity profile] Алексей Орлов (from livejournal.com)
Тут еще какое дело... Насчет конкретной библиотеки ничего посоветовать не могу, не знаком. Но в питоне и не только первое дело - зафиксировать версии библиотек, используемых в проекте. Иначе ближайшее обновление имеет шансы проект сломать. Ключевое слово - virtual environment. И тут мы открываем банку с червями. В питоне, для решения любой проблемы, включая фундаментальные, всегда есть целый зоопарк альтернативных инструментов. Virtual environment не исключение. Могу посоветовать Poetry, но придется же превращаться в профессионала, что ни выбирай.

На какой операционной системе дело происходит (Windows, Mac, Linux)?

Date: 2022-06-30 03:39 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
> Иначе ближайшее обновление имеет шансы проект сломать.

В общем, это всё что нужно знать, если есть выбор на чем писать.

Про virtual environment никогда не слышал - пролетело выше головы.

Windows.

Date: 2022-06-30 03:45 pm (UTC)
From: [identity profile] Алексей Орлов (from livejournal.com)
Насколько могу судить, в данной предметной области есть выбор между Python и R. Питон разностороннее будет, но порог вхождения повыше. Все зависит от диаметра иглы, в общем.

Date: 2022-06-30 04:11 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
Я мог бы все это сделать в Матлабе в 10 раз быстрее, проще и удобнее. Но есть неприятная перспектива, что на работе просто придется что-то делать на питоне, так что я решил как бы немного подготовиться. Но не ожидал, что будет так скверно.

Date: 2022-06-30 06:21 pm (UTC)
From: [identity profile] Алексей Орлов (from livejournal.com)
Да, да, та самая версатильность :)

Если действовать по принципу "на охоту идти - собак кормить", скверность будет преследовать упорно. Осваивать еще одну профессию, тоже перспектива так себе. Лучше поискать лично приемлемый компромисс и преодолеть порог вхождения малой кровью.

Могу порекомендовать книгу Fluent Python, by Luciano Ramalho. Текст не просто содержательный - элегантный, я бы сказал. Редкость для учебника. Уровень не нулевой, но что-то мне подсказывает - подойдет как раз.

Если окажется out of print, или еще что, найдем способ переслать pdf.

И еще: без гита (гитхаба) в наши дни писать программу длиннее пятнадцати строк не рекомендуется. Освоить надо непременно. Это без питона жизнь есть, без гита - уже нет. Можно еще иметь в виду, что гит архиполезен при работе с любой plain text информацией, не только с текстами программ, где он нынче незаменим.
Edited Date: 2022-06-30 06:35 pm (UTC)

Date: 2022-06-30 09:20 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
> Лучше поискать лично приемлемый компромисс и преодолеть порог вхождения малой кровью

That was the idea.

Книжку украл, спасибо. Правда не знаю когда буду читать.

Git я как бы пользую по работе, но поскольку он нужен примерно раз в квартал, то от раза к разу забываю что к чему, так что только по шпаргалке.

Дома тоже как-то раз ставил, использовал для одного проекта, и не помню чтоб сносил, но по факту его нет. Чудеса. Но надо будет и правда поставить, хотя я всё же привык к SVN и переучиваться на старости лет мне лень.

Date: 2022-07-01 05:44 am (UTC)
From: [identity profile] Алексей Орлов (from livejournal.com)
>> Книжку украл, спасибо. Правда не знаю когда буду читать.

В шезлонге у бассейна, не?

>> Git я как бы пользую по работе, но поскольку он нужен примерно раз в квартал, то от раза к разу забываю что к чему, так что только по шпаргалке.

О, для начала вполне достаточно! Одной проблемой меньше. Уровень лучше, чем по шпаргалке, требуется, когда дело до совместной работы доходит. Но это же не прям завтра? SVN не надо бы, там сегодня пустыня и голодные стервятники вокруг скелета саблезубого тигра.

Date: 2022-07-01 01:47 pm (UTC)
From: [identity profile] ny-quant.livejournal.com

То то на работе заставили на git перейти.

Напрягать голову у бассейна не хочется даже если это нужно по работе, но посмотрим как пойдет.

(no subject)

From: [identity profile] Алексей Орлов - Date: 2022-07-01 02:31 pm (UTC) - Expand

(no subject)

From: [identity profile] ny-quant.livejournal.com - Date: 2022-07-01 02:48 pm (UTC) - Expand

(no subject)

From: [identity profile] Алексей Орлов - Date: 2022-07-01 03:00 pm (UTC) - Expand

Date: 2022-06-30 04:01 pm (UTC)
From: [identity profile] nefedor.livejournal.com

VE - это в PyCharm настраивается элементарно.
На самом деле не все так страшно. У тебя с самого начала есть некий набор - определённая версия питона, нампая, сайпая и панды. Долгое время ты будешь работать именно с этим. В отдаленном будущем, да, возможно сломать устойчивость апгрейдом, скажем, панды до новой версии - но это всегда так, в любой системе.
Питон и нампай - очень устойчивые, обычно код десятилетней давности работает (кроме питон2->питон3). А вот про панду я слышал нехорошие вещи.

А ещё для рисерчеров есть Jupiter notebook. Это как раз про воспроизводимость результатов.

Date: 2022-06-30 04:13 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
У меня уже был один такой эпизод. Нарыл что-то в документации, написал кусок кода, а питон мне и говорит, что этот метод то ли уже deprecated то ли скоро будет.

Date: 2022-06-30 03:19 pm (UTC)
From: [identity profile] nefedor.livejournal.com

Я с PyCharm только и работаю. Не знаю как я жил раньше ;)

Date: 2022-07-05 09:36 am (UTC)
From: [identity profile] Алексей Орлов (from livejournal.com)
Кстати, про отладку.

Визуальный отладчик - это красиво, как галифе от Гуго Босса, но далеко не всегда так же полезно. Есть понятие юнит-тестирования (Unit Test). Это, по сути дела, та же трассировка (print("whatever you are curious about")), но с азартными играми и барышнями. При этом: (1) трассировка не засирает основной код; (2) она сохраняется; (3) всегда можно посмотреть снова; (4) это комментарии, которые никогда не врут; (5) и это только начало...

https://stackoverflow.com/questions/41852686/how-do-you-unit-test-python-dataframes

Стандартный питон: при поиске попадутся библиотеки unittest и pytest. Промышленным стандартом, на сегодняшний день, является pytest.

Date: 2022-07-05 03:16 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
Мне очень даже приходиось иметь дело с юнит-тестами. Когда речь шла о библиотеке на миллион строчек кода с сотнями классов, это было важно, нужно и полезно. На работе сейчас тоже есть некий framework но я там пока что ничего полезного не делаю. Для моих скромных домашних проектов, мне кажется это пока что не нужно. Если код будет расти (надеюсь, что нет) то надо будет пересмотреть.

Date: 2022-07-05 05:17 pm (UTC)
From: [identity profile] Алексей Орлов (from livejournal.com)
Вообще прекрасно!

Правда, когда набежал миллион строк кода, несколько поздно надевать пояс девственности. Двести строк тестов на тысячу строк собственной неосторожности, более или менее. Начинать рекомендуется сразу, a.k.a. TDD :)

Date: 2022-07-05 05:34 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
Пока что у меня меньше 200. Кое что ещё надо добавить, чтобы предотвратить root cause "ошибки", из-за которой появился этот пост, но ясно, что и до 300 вряд ли дойдет. Дальше или на свалку или буду богатый и счастливый.

Вообще, лень трудно победить рациональными аргументами и опытом чужих ошибок ;)

Date: 2022-07-06 09:46 pm (UTC)
From: [identity profile] ta-conversation.livejournal.com
>> или буду богатый и счастливый

За чей-то счёт или же прибавочная стоимость? :-)

P.S.
Всем спасибо за этот пост :-)

Date: 2022-07-06 11:10 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
Ммм, не знаю как ответить. За счет market-makers, наверное.

Date: 2022-07-07 05:46 pm (UTC)
From: [identity profile] ny-quant.livejournal.com
Понял, что ответил неправильно.

В данном случае, я торгую опционами, которые по своей природе игра с нулевой суммой, пренебрегая комиссионными.

Но market-makers, которые продают мне (или покупают у меня) опционы не просто сидят и смотрят чем кончится дело, а закрывают свои позиции путем сделок противоположного знака с другими участниками рынка, а также активно хеджируются. Так что, если у меня прибыль, то у кого именно убыток сказать невозможно.

(no subject)

From: [identity profile] ta-conversation.livejournal.com - Date: 2022-07-08 09:27 pm (UTC) - Expand

Date: 2022-07-06 10:04 pm (UTC)
From: [identity profile] ta-conversation.livejournal.com
>> Я мог бы все это сделать в Матлабе в 10 раз быстрее, проще и удобнее.

И, на мой взгляд, если действительно есть хоть малейший шанс на успех, то обязательно пишите в той системе, которой уверенно владеете.

(no subject)

From: [identity profile] ny-quant.livejournal.com - Date: 2022-07-06 11:12 pm (UTC) - Expand

Date: 2022-07-02 01:01 am (UTC)
ak_47: (default)
From: [personal profile] ak_47
PyCharm это gateway drug. Неподготовленным людям опасно давать! :)

Date: 2022-07-04 05:47 pm (UTC)
From: [identity profile] nefedor.livejournal.com

Что в нем такого эдакого? То же самое что и раньше, только много удобнее.

Date: 2022-07-04 09:23 pm (UTC)
ak_47: (default)
From: [personal profile] ak_47
Это я неудачно пошутил. Конечно, PyCharm замечательный инструмент.

Profile

ny_quant: (Default)
ny_quant

January 2026

S M T W T F S
    123
45 6 7 8 9 10
11 12 13 14151617
18192021222324
25262728293031

Most Popular Tags

Style Credit

Expand Cut Tags

No cut tags
Page generated Jan. 15th, 2026 04:40 am
Powered by Dreamwidth Studios