{"as_of":"2026-08-09T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c209be231392a463bd35bcd168633ccf9a26c7dca18d9f5d13801c45e3febe9b","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:27:30.228258Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.06441/citation-record","integrity":"/paper/2601.06441/integrity","json":"/paper/2601.06441/citation-record.json","paper":"/paper/2601.06441"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1906.09529","last_updated":"2020-12-09T04:13:25Z","snapshot_observed_at":"2026-07-06T08:02:11.026981Z","submitted_at":"2019-06-23T01:54:36Z","title":"Learning Activation Functions: A new paradigm for understanding Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.09529","snapshot_observed_at":"2026-08-03T11:27:30.167054Z","title":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.167054Z"},"links":{"cited_paper":"/paper/1906.09529","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:5a479b7793ffe61eb2930c37e445759f448f80d83e81a809fae85681f9ce7b1c","observation_id":"31bc019f-874f-4f38-92ba-b3084291b05a","resolution":{"observed_at":"2026-08-03T11:27:30.167054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09442","last_updated":"2021-12-17T11:23:03Z","snapshot_observed_at":"2026-08-09T20:26:14.187432Z","submitted_at":"2021-12-17T11:23:03Z","title":"Adaptively Customizing Activation Functions for Various Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09442","snapshot_observed_at":"2026-08-03T11:27:30.171106Z","title":"Eric Jang, Shixiang Gu, and Ben Poole","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.171106Z"},"links":{"cited_paper":"/paper/2112.09442","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:42a87424cbddc26bea3cf6557f131d3ce2da82659c2ee2a2b3eb6dbd3e4c80a9","observation_id":"8a7ff5f7-cd19-4c9e-892c-8df1fcbe4199","resolution":{"observed_at":"2026-08-03T11:27:30.171106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-03T11:27:30.179400Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.179400Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:1c4f6e4fcedb7873a5ecb4496c83c8f5895b9d1a398e1b33d601d70a033062bc","observation_id":"804835c1-5396-41a8-9569-97599cacca8f","resolution":{"observed_at":"2026-08-03T11:27:30.179400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.04051","last_updated":"2016-11-12T22:54:45Z","snapshot_observed_at":"2026-07-06T05:18:23.829742Z","submitted_at":"2016-11-12T22:54:45Z","title":"GANS for Sequences of Discrete Elements with the Gumbel-softmax Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.04051","snapshot_observed_at":"2026-08-03T11:27:30.183067Z","title":"Ziming Liu, Yixuan Wang, Sachin Vaidya, Fabian Ruehle, James Halverson, Marin Soljačić, Thomas Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.183067Z"},"links":{"cited_paper":"/paper/1611.04051","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:ea695176d2a351db91450c5c46fc61b38adc52ebaf6108bb3d3c3aa6cd4458db","observation_id":"411bd474-9487-43a1-8a0d-907d378db3ab","resolution":{"observed_at":"2026-08-03T11:27:30.183067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:27:30.190248Z","title":"URLhttp://dx.doi.org/10.1109/ICPR.2018.8545362","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.190248Z"},"links":{"citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:d629750694a67952e230575682275c16291f1865de4f4a2327928f11c923c00a","observation_id":"5773cbfc-c11d-4e0b-aacc-7f11b2f4dcb3","resolution":{"observed_at":"2026-08-03T11:27:30.190248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02763","last_updated":"2018-04-08T22:16:36Z","snapshot_observed_at":"2026-08-06T16:24:38.655212Z","submitted_at":"2018-04-08T22:16:36Z","title":"Comparison of non-linear activation functions for deep neural networks on MNIST classification task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02763","snapshot_observed_at":"2026-08-03T11:27:30.197705Z","title":"Comparison of non-linear activation functions for deep neural networks on mnist classifica- tion task.arXiv preprint arXiv:1804.02763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.197705Z"},"links":{"cited_paper":"/paper/1804.02763","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:045ee1473a7c8bfe11ea4b3b170a80e9b4c854c06117f1e01ffde2d36fdf45ed","observation_id":"27eb89ec-f8d6-4bcd-b166-1a6d95b2fdcf","resolution":{"observed_at":"2026-08-03T11:27:30.197705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04735","last_updated":"2017-11-13T18:06:09Z","snapshot_observed_at":"2026-07-31T19:03:01.416419Z","submitted_at":"2017-11-13T18:06:09Z","title":"Resurrecting the sigmoid in deep learning through dynamical isometry: theory and practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.04735","snapshot_observed_at":"2026-08-03T11:27:30.201770Z","title":"12 Preprint, Under Review Prajit Ramachandran, Barret Zoph, and Quoc V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.201770Z"},"links":{"cited_paper":"/paper/1711.04735","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:d4df396d1a3358cb0b0c3a692ffd6cfcb9ac8f20ec4001b53f8426004f5f4c8d","observation_id":"e0f83012-1c77-4bc8-8f05-cd85d83b87da","resolution":{"observed_at":"2026-08-03T11:27:30.201770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-03T11:27:30.205378Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.205378Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:be800e1cb7d323e7439600496e56989541f6c9ee8ab97332119f40807e186aef","observation_id":"829f2f89-e2c3-423b-bbc2-53d17c190b2a","resolution":{"observed_at":"2026-08-03T11:27:30.205378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:27:30.213045Z","title":"URLhttps://dx.doi.org/10.1088/1741-2552/ac115d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.213045Z"},"links":{"citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:3d9f78484cd5376494b268d49bd3157614ca9ffdb710e8743005277cf21384ba","observation_id":"4e6da1b0-e4a2-4e1f-b82e-6bc16fcb37e9","resolution":{"observed_at":"2026-08-03T11:27:30.213045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07261","last_updated":"2016-08-23T16:42:29Z","snapshot_observed_at":"2026-07-06T04:47:06.608643Z","submitted_at":"2016-02-23T18:44:39Z","title":"Inception-v4, Inception-ResNet and the Impact of Residual Connections on Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07261","snapshot_observed_at":"2026-08-03T11:27:30.216522Z","title":"Mohammadamin Tavakoli, Forest Agostinelli, and Pierre Baldi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.216522Z"},"links":{"cited_paper":"/paper/1602.07261","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:8802cf1ef51d31ee22324152782f59a87da7b9f063b3d64d465ac5fc56a7e7ac","observation_id":"4500b0dd-dd32-4a99-9830-571f0828e659","resolution":{"observed_at":"2026-08-03T11:27:30.216522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08947","last_updated":"2020-06-16T06:45:55Z","snapshot_observed_at":"2026-08-07T04:04:45.047472Z","submitted_at":"2020-06-16T06:45:55Z","title":"SPLASH: Learnable Activation Functions for Improving Accuracy and Adversarial Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.08947","snapshot_observed_at":"2026-08-03T11:27:30.220341Z","title":"A Vaswani","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.220341Z"},"links":{"cited_paper":"/paper/2006.08947","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:d65f56502d4cda976e566c56628bd6670a1f0e002931292c21a40a76a7aa980f","observation_id":"81128ec8-2239-4a77-9ecb-c77236ec93d7","resolution":{"observed_at":"2026-08-03T11:27:30.220341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-03T11:27:30.224570Z","title":"Hongyi Zhang, Yann N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.224570Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:e0bff1d142cd9131467c51b498c19631c1ddaa61bf26bade8305ce3fcc15879e","observation_id":"f90fdc79-5489-44cf-aa10-79076bd78829","resolution":{"observed_at":"2026-08-03T11:27:30.224570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.09321","last_updated":"2019-03-12T00:31:18Z","snapshot_observed_at":"2026-07-06T07:29:14.938525Z","submitted_at":"2019-01-27T05:30:11Z","title":"Fixup Initialization: Residual Learning Without Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.09321","snapshot_observed_at":"2026-08-03T11:27:30.228258Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.228258Z"},"links":{"cited_paper":"/paper/1901.09321","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:4924a14726902d712cb5d8c20989251c779e34ba83bbf85e8776cafa7001d1bf","observation_id":"157be54b-1a20-4dff-be23-9fbc6d4480ea","resolution":{"observed_at":"2026-08-03T11:27:30.228258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.03378","last_updated":"2018-11-08T12:28:43Z","snapshot_observed_at":"2026-07-06T07:13:28.785701Z","submitted_at":"2018-11-08T12:28:43Z","title":"Activation Functions: Comparison of trends in Practice and Research for Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.03378","snapshot_observed_at":"2026-08-03T11:27:30.193902Z","title":"Activation functions: Comparison of trends in practice and research for deep learning.arXiv preprint arXiv:1811.03378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.193902Z"},"links":{"cited_paper":"/paper/1811.03378","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:f4ef286a2e1e31d580ec9614ba03f02d998f11698a4a99ac5857d2c174666107","observation_id":"caf43ddc-5852-4a3a-90a4-9fa420d7d244","resolution":{"observed_at":"2026-08-03T11:27:30.193902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6120","last_updated":"2014-02-19T17:26:57Z","snapshot_observed_at":"2026-08-08T04:46:43.735461Z","submitted_at":"2013-12-20T20:24:00Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6120","snapshot_observed_at":"2026-08-03T11:27:30.209291Z","title":"Thomas Strypsteen and Alexander Bertrand","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.209291Z"},"links":{"cited_paper":"/paper/1312.6120","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:82bc2cd0ca31627159a7a87583c42f72ca6b7df3ce882fbd4d792050768bf03f","observation_id":"6944238d-3b8c-44ee-b444-9658e2d2471d","resolution":{"observed_at":"2026-08-03T11:27:30.209291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-03T11:27:30.155044Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.155044Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:74ac969ec2f0059bd7b7a80caea3b56287ca99a3e7ce1303e7615a2120218967","observation_id":"74a6d9cc-ca55-42f0-b99a-51e3b3118e04","resolution":{"observed_at":"2026-08-03T11:27:30.155044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-03T11:27:30.142393Z","title":"David Balduzzi, Marcus Frean, Lennox Leary, JP Lewis, Kurt Wan-Duo Ma, and Brian McWilliams","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.142393Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:439eefc1d3e5d313170547427d3c0c5ad53a3bbca4e9936c0fd429147a5c576e","observation_id":"3c8dec2a-3c0e-4da4-8c8a-892208fe8eec","resolution":{"observed_at":"2026-08-03T11:27:30.142393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-03T11:27:30.175509Z","title":"Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.175509Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:a9565adf1901bd372353d0dfa4aebdf73139fc2931940e5d4a24cabbfefbe1bb","observation_id":"11c33fd4-3c5b-42d8-bcbc-a27ce772912c","resolution":{"observed_at":"2026-08-03T11:27:30.175509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08591","last_updated":"2018-06-06T10:08:21Z","snapshot_observed_at":"2026-07-06T05:31:40.572534Z","submitted_at":"2017-02-28T01:06:13Z","title":"The Shattered Gradients Problem: If resnets are the answer, then what is the question?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.08591","snapshot_observed_at":"2026-08-03T11:27:30.146537Z","title":"Yoshua Bengio, Nicholas Léonard, and Aaron Courville","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.146537Z"},"links":{"cited_paper":"/paper/1702.08591","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:73effb10793e012c8f0a27c6751b6ba80220403521016b0eceb03a301f44edbb","observation_id":"67f8ebf0-2c21-4eb7-852c-8173c0f75cc5","resolution":{"observed_at":"2026-08-03T11:27:30.146537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-03T11:27:30.137358Z","title":"Jimmy Lei Ba, Jamie Ryan Kiros, and Geoffrey E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.137358Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:ce2c448fc216eceb335131c87e8f8536cf324db6bc07170f9166b47585ecbcb8","observation_id":"112f9c90-be7b-4ec1-b0de-d52d22eb9acf","resolution":{"observed_at":"2026-08-03T11:27:30.137358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.01902","last_updated":"2020-09-30T09:16:55Z","snapshot_observed_at":"2026-07-06T09:09:51.890343Z","submitted_at":"2020-04-04T10:36:11Z","title":"Rational neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.01902","snapshot_observed_at":"2026-08-03T11:27:30.150931Z","title":"Djork-Arné Clevert","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.150931Z"},"links":{"cited_paper":"/paper/2004.01902","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:040be810f8a72aa64682292e6e74b3aa83ad64e4e9f98308a034b39bf3a00609","observation_id":"4495f8c4-bb49-4f87-a265-d3d498e51634","resolution":{"observed_at":"2026-08-03T11:27:30.150931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T11:27:30.159102Z","title":"org/abs/2010.11929","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.159102Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:c018a3dc8e0b5d42b565599815d1d048be0b48c9c17d243f46eaf1f5121acc76","observation_id":"140026bb-0753-455e-bf1d-7e326a5f90da","resolution":{"observed_at":"2026-08-03T11:27:30.159102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14545","last_updated":"2022-06-28T04:13:53Z","snapshot_observed_at":"2026-08-03T23:23:41.362996Z","submitted_at":"2021-09-29T16:41:19Z","title":"Activation Functions in Deep Learning: A Comprehensive Survey and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14545","snapshot_observed_at":"2026-08-03T11:27:30.163142Z","title":"Xavier Glorot and Yoshua Bengio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.163142Z"},"links":{"cited_paper":"/paper/2109.14545","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:6cd9298d5f42452f400f9e46d7569e8bc98d8e288ef3c48cf19e688826a4740f","observation_id":"40cf83a4-dcc1-4add-af58-ce5831ba0ba9","resolution":{"observed_at":"2026-08-03T11:27:30.163142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19756","last_updated":"2025-02-09T21:09:09Z","snapshot_observed_at":"2026-07-06T18:07:47.744531Z","submitted_at":"2024-04-30T17:58:29Z","title":"KAN: Kolmogorov-Arnold Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19756","snapshot_observed_at":"2026-08-03T11:27:30.186715Z","title":"Andrew L Maas, Awni Y Hannun, Andrew Y Ng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T11:27:30.186715Z"},"links":{"cited_paper":"/paper/2404.19756","citing_paper":"/paper/2601.06441"},"observation_digest":"sha256:845a9ee3a3d5f0740c8ed88cbe2be80997b93eb22ca55d7deabc804d29cdcda4","observation_id":"00013af1-7ebd-4cd4-bff4-04003a97ab8b","resolution":{"observed_at":"2026-08-03T11:27:30.186715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.06441","last_updated":"2026-07-07T04:53:43Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T01:18:01.614555Z","submitted_at":"2026-01-10T05:51:25Z","title":"FlexAct: Why Learn when you can Pick?"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2601.06441."}