{"as_of":"2026-08-09T17:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c27c5ca2a6f7d5d0601c3be4556b4298f121fc0e1bcead55027af79af4ffbc51","coverage":[{"denominator":182,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:06:51.147174Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19795/citation-record","integrity":"/paper/2507.19795/integrity","json":"/paper/2507.19795/citation-record.json","paper":"/paper/2507.19795"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-06T14:06:46.655990Z","title":"Semdedup: Data-efficient learning at web-scale through semantic deduplication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.655990Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:14b93f6fe9d5bee4ed05f946081bdadfc2a0b20fb6f308609721357c8be4fe6e","observation_id":"070c60c3-5d12-491b-9f6c-e83e702dd58f","resolution":{"observed_at":"2026-08-06T14:06:46.655990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.696576Z","title":"Dbpedia: A nucleus for a web of open data","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.696576Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:6d4fb42ddfbd400ebcc2179e87df4ee77d8b6d21bc4a9a143ead2e299c2c4882","observation_id":"a759c726-2c8d-4e10-8f58-ebadc4394e3a","resolution":{"observed_at":"2026-08-06T14:06:46.696576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.715625Z","title":"Neural machine translation by jointly learning to align and translate, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.715625Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8e1e051beaac0d4b16bdf2208640a7b48b9f2926e40946a9a6a01e133ec19f8c","observation_id":"6c0ac0c8-8591-41fb-96bb-39f89a606437","resolution":{"observed_at":"2026-08-06T14:06:46.715625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.755360Z","title":"Distilling the knowledge from conditional normalizing flows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.755360Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d40a316eea8e47df5b296fce4edb0fcfbee48d07f461b90d78a8d77bd51df45a","observation_id":"089fca25-278d-4ce5-a8b0-bbc58350984d","resolution":{"observed_at":"2026-08-06T14:06:46.755360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.795478Z","title":"Semantic photo manipulation with a generative image prior","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.795478Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8aa867ff4f7c6ce10eee5860ec983dcfd2c1a81c939f9d19b04c955c251161b8","observation_id":"ec860435-881d-4b73-96f4-c89e0b03798b","resolution":{"observed_at":"2026-08-06T14:06:46.795478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.808841Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.808841Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d24e762df6ec922ec48890cb164375685bc7392b20645c180fcbee959fd29979","observation_id":"7bd85612-fb82-49a4-b209-616fdea7f9e8","resolution":{"observed_at":"2026-08-06T14:06:46.808841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T14:06:46.853428Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.853428Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:550a5e4a98b266c535e4ad2f9480ddccbe723919aaacf2732d3804923f379e1a","observation_id":"1a147371-7cbd-4c61-8baa-4ef2a26f1f0d","resolution":{"observed_at":"2026-08-06T14:06:46.853428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05649","last_updated":"2019-02-20T18:36:23Z","snapshot_observed_at":"2026-08-07T08:55:31.909762Z","submitted_at":"2018-03-15T09:15:14Z","title":"Sylvester Normalizing Flows for Variational Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05649","snapshot_observed_at":"2026-08-06T14:06:46.903070Z","title":"Tomczak, and Max Welling","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.903070Z"},"links":{"cited_paper":"/paper/1803.05649","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:e76bacf3c0c8cc86ffcf02efda675ea071a6f39f5a7b9d6bb36356694e8435a6","observation_id":"b09a2656-3a25-493b-bad9-05d54049a079","resolution":{"observed_at":"2026-08-06T14:06:46.903070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.962524Z","title":"Unleashing transformers: Parallel token prediction with discrete absorbing diffusion for fast high-resolution image generation from vector-quantized codes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.962524Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:08cc4bef8afff2fcdf9c752ef8cab5c36e2055779d73f2f2a05adc300018a898","observation_id":"d23f6cdf-ca66-4839-b6b7-e54635233acb","resolution":{"observed_at":"2026-08-06T14:06:46.962524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.993040Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.993040Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:2746258a7c1bb28abc4b4317f1ec4a6b758757e7d8681e35ceb05b67c7ea7ca6","observation_id":"e1a9daa0-2d9e-4549-8363-ebefb4a1729d","resolution":{"observed_at":"2026-08-06T14:06:46.993040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.075811Z","title":"Model compression","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.075811Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:6708e984bac3619b03ed1b4ab25fecf7a7832ea13c462e9025b4247b5a240b63","observation_id":"be09bf4a-29de-485b-82f0-4035df11f923","resolution":{"observed_at":"2026-08-06T14:06:47.075811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.143911Z","title":"Proxylessnas: Direct neural architecture search on target task and hardware","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.143911Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:963453a5b04d03340c24326742204b96cfd178efc6b73745e637a4ddeeb22c21","observation_id":"793d2b1d-683f-483c-9e7c-9c15c5782389","resolution":{"observed_at":"2026-08-06T14:06:47.143911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.247730Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.247730Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:45035daf6ebab0a651d3ab334917d383036b35c08bb5a598733324f4b3b00509","observation_id":"a1895085-fd07-4ccd-94fe-43f42a7465f5","resolution":{"observed_at":"2026-08-06T14:06:47.247730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.347070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.347070Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a3320f4c628c3a6dbfcb330c303a18146acaa4a2de106e650adf612187d323bb","observation_id":"648918c6-b4d4-4d93-8a5d-c85f7e183672","resolution":{"observed_at":"2026-08-06T14:06:47.347070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02735","last_updated":"2020-07-24T02:15:24Z","snapshot_observed_at":"2026-08-03T20:21:58.372162Z","submitted_at":"2019-06-06T17:55:01Z","title":"Residual Flows for Invertible Generative Modeling","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02735","snapshot_observed_at":"2026-08-06T14:06:47.443142Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.443142Z"},"links":{"cited_paper":"/paper/1906.02735","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:0ba6ad97c42bc23f3dcd217754c615a34a99864f03c51016b6811c662640ab95","observation_id":"7df8bb55-940e-47a9-b346-2bc0ab49f12d","resolution":{"observed_at":"2026-08-06T14:06:47.443142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.543576Z","title":"On the relationship between self-attention and convolutional layers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.543576Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:76d7c137baf1e849bc4f5202d96af05a92a3fc96950ca62245e685e852fa8f85","observation_id":"9a1682e7-47c9-420c-9f35-1c34f167d119","resolution":{"observed_at":"2026-08-06T14:06:47.543576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.582930Z","title":"Scalable high-resolution pixel-space image synthesis with hourglass diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.582930Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c075884ebc7240d8c3538694dd925bf362eba33eb159103ab2bdbcb105750aa0","observation_id":"8c4a8b1f-a3e8-4641-a9aa-ff205bec0056","resolution":{"observed_at":"2026-08-06T14:06:47.582930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.618477Z","title":"Approximation with artificial neural networks.Faculty of Sciences, Etvs Lornd University, Hungary , 24(48):7, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.618477Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c038204dc92c0bd73f1a9b952d3398e9b8efb2e37aaeb62a4a5ab93dfbee1886","observation_id":"a41f28e4-da3e-4bf5-8475-09ea1fb42f2f","resolution":{"observed_at":"2026-08-06T14:06:47.618477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.636071Z","title":"Randaugment: Practical automated data augmentation with a reduced search space","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.636071Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:5d92da7a50c60b4a91908cf8d45a3f7b8de6c0df8c5a9ce150be01e126c20698","observation_id":"e9ee7828-92c1-4ae1-9230-5ec823e32374","resolution":{"observed_at":"2026-08-06T14:06:47.636071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08698","last_updated":"2023-07-17T17:57:56Z","snapshot_observed_at":"2026-08-04T12:09:15.933692Z","submitted_at":"2023-07-17T17:57:56Z","title":"Flow Matching in Latent Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08698","snapshot_observed_at":"2026-08-06T14:06:47.673758Z","title":"Flow matching in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.673758Z"},"links":{"cited_paper":"/paper/2307.08698","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:e6c37e12186d7ee9e3cfe884c0fb246ec77d92c488033893c606c565a960bdec","observation_id":"1377b4c8-5e6f-4294-a304-ee8998b1ec70","resolution":{"observed_at":"2026-08-06T14:06:47.673758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.709194Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.709194Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d7f333ef2e01328a022d34d41308a9d0b06b2380945404d91df5b7da42515f0a","observation_id":"4276fdd8-b0ca-48b1-a64d-9df14e2d5321","resolution":{"observed_at":"2026-08-06T14:06:47.709194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.745710Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.745710Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:743d884dcca974f7f607cf98f55bcac96fd9ab6dd2715cd178fd84b87057da22","observation_id":"93270ccd-e48d-4eb7-b9a8-9b70c4876cf7","resolution":{"observed_at":"2026-08-06T14:06:47.745710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.783734Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.783734Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:80d6dca08b649761ae3d992ade27b639ad35b48e6826d085a2d548fe2f08a87b","observation_id":"5474901a-2ac5-495f-9ee7-d739c862d9db","resolution":{"observed_at":"2026-08-06T14:06:47.783734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.822039Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.822039Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:854f5e5db0e39258d4a582f20e0cfa34878f49c5609698e5c7338087ffdcdc8e","observation_id":"f368c111-dd35-4f9f-89b1-20d09b229c8e","resolution":{"observed_at":"2026-08-06T14:06:47.822039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.868578Z","title":"Ensemble methods in machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.868578Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:3927376d7f14525c1efdadb6d50df2737df7f422592d77b0768e2006790c0c7f","observation_id":"06d97509-c12a-455d-8b0f-1ce73856a2a9","resolution":{"observed_at":"2026-08-06T14:06:47.868578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.915496Z","title":"Density estimation using real nvp, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.915496Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:5b617b5ddaa191eb79698f2121ee00d888d1812ef775c862be652064919a7005","observation_id":"c3b2a7ae-134e-4616-b343-25314c3569d8","resolution":{"observed_at":"2026-08-06T14:06:47.915496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.05168","last_updated":"2020-04-13T00:01:14Z","snapshot_observed_at":"2026-07-06T08:50:34.361183Z","submitted_at":"2020-01-15T08:05:55Z","title":"Invertible Generative Modeling using Linear Rational Splines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.05168","snapshot_observed_at":"2026-08-06T14:06:48.001419Z","title":"Dolatabadi, Sarah Erfani, and Christopher Leckie","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.001419Z"},"links":{"cited_paper":"/paper/2001.05168","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:9963223a0097bc7b3d48b122547617400ef1b997bb6f5c472293c3b24a16ca38","observation_id":"906ab785-7c60-4d47-bb7b-2fa3549beab9","resolution":{"observed_at":"2026-08-06T14:06:48.001419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.066250Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.066250Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8e6c08f736f52aecd365835b2cca21ccd8c2d8657b5bccc6a1dd9d8b3a287459","observation_id":"dda88302-748c-4afa-9a39-c7b899fd8ff1","resolution":{"observed_at":"2026-08-06T14:06:48.066250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.125063Z","title":"Augmented Neural ODEs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.125063Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:2b8814f936c8e40e89d30630b53cd881acee4e31c65e1b7cba90fae8041a4070","observation_id":"5bfa5ba9-729b-4fad-9612-b6b269492633","resolution":{"observed_at":"2026-08-06T14:06:48.125063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02145","last_updated":"2019-06-05T17:05:53Z","snapshot_observed_at":"2026-07-06T07:58:12.570715Z","submitted_at":"2019-06-05T17:05:53Z","title":"Cubic-Spline Flows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02145","snapshot_observed_at":"2026-08-06T14:06:48.167137Z","title":"Cubic- Spline Flows, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.167137Z"},"links":{"cited_paper":"/paper/1906.02145","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:4b70f2435a073e9f364bc268e69154365deaa0f17d2ed5050bbe078190abf75e","observation_id":"77439084-6c1d-4a41-81c4-f23f778dba6a","resolution":{"observed_at":"2026-08-06T14:06:48.167137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.206848Z","title":"Softmax linear units","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.206848Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:e63060830fed337eb5d87004bd2a9423eec6a75cfc7d218bf6885938bd80687b","observation_id":"28b67fa9-d277-431e-9ee7-6d37db9250d9","resolution":{"observed_at":"2026-08-06T14:06:48.206848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.286909Z","title":"Visualizing higher-layer features of a deep network, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.286909Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:781595c81463acfcfe62a8f2d7fcbba55b6f1423f126e91a7cbccd3a5a70fa1a","observation_id":"2aa7e9b5-deb8-464f-a6ec-053bd6ee0813","resolution":{"observed_at":"2026-08-06T14:06:48.286909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.387069Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.387069Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:da747ac0a5acf223da69994c0f70f2b86f18734c72157b6a4c6d9c28758913c7","observation_id":"666fe322-2a35-4355-862e-ae439a8a9f86","resolution":{"observed_at":"2026-08-06T14:06:48.387069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.421234Z","title":"Fuhr and Michael Kallay","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.421234Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7fe8855a9db9707b86f2b8cee777b1bbff61356ced5ea9c7fc0c889ee00ca32f","observation_id":"ff0831d4-cb96-423a-bfc3-0c6018b91b3c","resolution":{"observed_at":"2026-08-06T14:06:48.421234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.461605Z","title":"A new algorithm for data compression","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.461605Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:b0148b8c9bc1af7e6378890e54a821f88194740fbe99ac47a5b05b20e12c53d2","observation_id":"dc64602e-a2de-44c8-a48c-a3a496f7e955","resolution":{"observed_at":"2026-08-06T14:06:48.461605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.502505Z","title":"Swagan: A style-based wavelet-driven generative model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.502505Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:edadbb1cdedeb70439de9cd71392e2ba7e194ccffafbc2dfcf3a39c80244559e","observation_id":"58fc5889-3e95-47d1-b36d-44e19b67a47f","resolution":{"observed_at":"2026-08-06T14:06:48.502505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.520479Z","title":"Masked diffusion transformer is a strong image synthesizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.520479Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a3a90a5b64c7df3ff78635c56e7ee3857b0590a82408e9aed79c745c1e648616","observation_id":"78168745-2ac9-467d-9653-c95141ecf360","resolution":{"observed_at":"2026-08-06T14:06:48.520479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.563673Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.563673Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c4f41bcc1f02cb3c52f18f491282f99fc1ae1ddbae79d28e9aea9336e11d6678","observation_id":"e756e0c4-60ea-4537-87d2-27cfe4c59a27","resolution":{"observed_at":"2026-08-06T14:06:48.563673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.640707Z","title":"Ganalyze: Toward visual definitions of cognitive image properties","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.640707Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:07b0d7b45dddbc0eb2573ea291e2205da9e0f05673c82e9cc7b58e8c634f8bc2","observation_id":"3c095272-db90-47a7-a99e-ff43dbfc3b74","resolution":{"observed_at":"2026-08-06T14:06:48.640707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.710389Z","title":"Deep Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.710389Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:0e9b930f911ce86d7137a5fe1b8317d30675273a04c146b6c7844f8394d2f886","observation_id":"8df19ef3-b00f-491d-8261-3a96665861d2","resolution":{"observed_at":"2026-08-06T14:06:48.710389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.793336Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde- Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.793336Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7738f4f49a0212706b8aece5953da4e9238e430088e6c7f0299c4c9c798b4b43","observation_id":"a23db819-178f-43a7-96eb-e04805a27d0a","resolution":{"observed_at":"2026-08-06T14:06:48.793336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.874583Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.874583Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:0477122754253600868aa71f217ed571d5918c189de43eeca74bea8b7dab2026","observation_id":"e2644c66-f890-4554-a1bf-05d458044f9e","resolution":{"observed_at":"2026-08-06T14:06:48.874583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.919018Z","title":"Neural turing machines, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.919018Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:342d56c6e0123eb47e32d55957d50930c410f976b0ae30399c6b9794e0ba00b7","observation_id":"34a3f24b-6fc6-44f9-aed6-cc7ca9e3b1e5","resolution":{"observed_at":"2026-08-06T14:06:48.919018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.942612Z","title":"Densely connected normalizing flows, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.942612Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:30262723d27dcbdee79a2edcd730a32087e2a6e86c39a6896387149f45deb37c","observation_id":"a7490690-3c38-48cc-b00b-16f999bcdea2","resolution":{"observed_at":"2026-08-06T14:06:48.942612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.983204Z","title":"Pattern theory: from representation to inference","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.983204Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f65fe9bb1d4f0128859e86190877aa2926a1fa9a337017a6f103c405ae3acfb1","observation_id":"fc805aa6-caa6-4b0b-9e3e-67a2a54ddf62","resolution":{"observed_at":"2026-08-06T14:06:48.983204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.024249Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.024249Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:543c9e41eaf870f0dd073da25f6a9caa825482215954502d3ba0ab7cb7530523","observation_id":"7b110edc-1df4-404a-9d97-13af0ac58142","resolution":{"observed_at":"2026-08-06T14:06:49.024249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.077179Z","title":"Starflow: Scaling latent normalizing flows for high-resolution image synthesis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.077179Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c0997a9c2920feadfcefdfc077a0d68713cc5b54b711e63074c3d0191574e8c7","observation_id":"e90ddf50-d7c0-4589-8ee7-55fa0168dae3","resolution":{"observed_at":"2026-08-06T14:06:49.077179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.127826Z","title":"Variational Inference with Orthogonal Normalizing Flows","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.127826Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:bfc2f267c08cae862221b825257c813e54d314fed3aae54d7af75400123870c2","observation_id":"53203af2-21cc-4ec3-a879-e31a22b3b649","resolution":{"observed_at":"2026-08-06T14:06:49.127826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.165078Z","title":"Neighborhood attention: Dynamic restriction of self-attention, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.165078Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:acdf2f27cc7b9f92948b7e3b01a739235982c5142c4183f0ed53457933fff35b","observation_id":"ae446254-25c6-4a3c-b0bf-6220bf1cca74","resolution":{"observed_at":"2026-08-06T14:06:49.165078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.181356Z","title":"Dilated neighborhood attention transformer, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.181356Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:57a669f9eccc5ec626cd9755f5f035ea52b03a96ac630e178079145d90ca5c20","observation_id":"135e01b6-f517-474a-bb6e-b2ffe06b7e23","resolution":{"observed_at":"2026-08-06T14:06:49.181356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.271019Z","title":"Escaping the big data paradigm with compact transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.271019Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:0dbaabf30273c28cdb285817237ba6116ca19ef643f60e88d64b27af2121a558","observation_id":"d17944df-d8ef-4c80-93f6-a45ffaa1f9c7","resolution":{"observed_at":"2026-08-06T14:06:49.271019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.336400Z","title":"Neighborhood attention transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.336400Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:fbc5747361705c95a0f7ba3731f061a350a750595213c6ef2d3b24eef539d1b8","observation_id":"bf6873b2-9d89-42d1-bf6a-711f2ec1323a","resolution":{"observed_at":"2026-08-06T14:06:49.336400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.377421Z","title":"Faster neighborhood attention: Reducing the O(n2) cost of self attention at the threadblock level, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.377421Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:2efbd368d96ce51d387a0dc09be4ae5089e29ecdab1dd067843b352437b386ce","observation_id":"c0511483-1d93-4508-839c-866a1922277c","resolution":{"observed_at":"2026-08-06T14:06:49.377421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.418782Z","title":"Generalized neighborhood attention: Multi-dimensional sparse attention at the speed of light, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.418782Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f4764d6bad6bb1bc3d2dcba95607b4674fec9e0cc1c6c051b82a0ed359f05b45","observation_id":"a8d0a652-8582-4b5b-a032-8089200028b7","resolution":{"observed_at":"2026-08-06T14:06:49.418782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.444359Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.444359Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:ec7a1228abbc0b40838d1a7d76cc7eb12286d027b4bf177cb858643b1fba142a","observation_id":"556311bd-ba03-47d9-9648-2e3006018c86","resolution":{"observed_at":"2026-08-06T14:06:49.444359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.451014Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.451014Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d6993c0c948078d851f700505e8a22d35908376b71709a86b312365425f7d65b","observation_id":"0a62a550-7e7d-4e1a-b71f-2d2b87ed7ae2","resolution":{"observed_at":"2026-08-06T14:06:49.451014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.463499Z","title":"Identity mappings in deep residual networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.463499Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c73aa68b999f368f63bdd33928c6c70df3d2a8f3f17633b1dc275342c675c8a5","observation_id":"73f9795b-119f-400a-bc37-8ba359cd43fe","resolution":{"observed_at":"2026-08-06T14:06:49.463499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.523726Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.523726Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:ff91bfa9b6cb2e27ef9b69aa441b11f9236a9555da369f7d036c12073eeebffd","observation_id":"a6e67e72-709f-49b2-be4c-63d62ef604cb","resolution":{"observed_at":"2026-08-06T14:06:49.523726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.585761Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.585761Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:b7b1c2d61d44e25b45e4afe4397fc63a2c536dc5beaab3d5a37d0a9153ed7b07","observation_id":"f594c7c4-00b7-40ad-96b7-da9bd77c1c62","resolution":{"observed_at":"2026-08-06T14:06:49.585761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.703823Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.703823Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a7b1e64fd8294545d7db9f77aaf711f11c79464166f5c60698e7d107b1203071","observation_id":"559425f9-1543-42bb-97e0-4f238b670c78","resolution":{"observed_at":"2026-08-06T14:06:49.703823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T14:06:49.832130Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.832130Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:fec9a8ecb19c1b20387f8767f61a5688064e210f09c30db666a576fca4b9767f","observation_id":"54af68a6-e965-4e7a-98fa-ea7b2f8d2726","resolution":{"observed_at":"2026-08-06T14:06:49.832130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.896163Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.896163Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:545a414abb7221c20f095a52950cc16b4657f6ed3acfe993ea50619d67c67154","observation_id":"792e3bff-b308-4942-9dc8-0032bf719ca5","resolution":{"observed_at":"2026-08-06T14:06:49.896163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.969256Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.969256Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:de33e4073dd7581475e0611a549b4080d9dd08a0802429ca4e92c4de09d14850","observation_id":"458c721f-6732-4dc3-a7d8-b645aee38e67","resolution":{"observed_at":"2026-08-06T14:06:49.969256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.992139Z","title":"The convolution exponential and generalized sylvester flows","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.992139Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:e850bc3688c39e81e2876430a85b8a3525aff892af8f84df3d8c9c1c8d39df3f","observation_id":"87162926-f4e5-4d78-8c67-ce0c938c78af","resolution":{"observed_at":"2026-08-06T14:06:49.992139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.032524Z","title":"Simple diffusion: End-to- end diffusion for high resolution images, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.032524Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:1ba6d77f725fa29eb4fc2be59dfa20152a0838585f1aca867bb66a72888869f4","observation_id":"1dd434c3-6241-4ef1-ace8-1d2a471e8245","resolution":{"observed_at":"2026-08-06T14:06:50.032524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.083346Z","title":"On the limitations of compute thresholds as a governance strategy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.083346Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:829794c0ddafc022e32a3033e669d804d796cea6d242ebab88c065659dfb7ad5","observation_id":"6e35e3dc-80fe-4749-a876-553ed8061a45","resolution":{"observed_at":"2026-08-06T14:06:50.083346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.126090Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.126090Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:6c4735bce4ce8362f55d79e09b7f09458aefe7d599eaf4e798485521cc1c24b7","observation_id":"09181edf-e9d4-45bd-9e06-adfec0f098ed","resolution":{"observed_at":"2026-08-06T14:06:50.126090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.175921Z","title":"Local relation networks for image recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.175921Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:e6867724c2214ad7cef18072064b45a1af2d8e85f08ce84c58c207e57429758a","observation_id":"273ad117-c694-4237-8a69-9902371222da","resolution":{"observed_at":"2026-08-06T14:06:50.175921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.244461Z","title":"Squeeze-and-excitation networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.244461Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:18486dc0d7ef828897391f9453e98e61c215254c9b878ad0433cd3f766fd5bb9","observation_id":"3bd1a13c-0cde-4b96-b40f-5b201fb2d4f8","resolution":{"observed_at":"2026-08-06T14:06:50.244461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.298063Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.298063Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:864380b9b531f9c8a5f75cf7d9068dfd0ef17e502f1d7ce075d351b3590354a8","observation_id":"e982c090-a566-410b-ad1f-5c19b26715fe","resolution":{"observed_at":"2026-08-06T14:06:50.298063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.386432Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.386432Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:15fd109d5ac6067362e4308c45a05fe09c9b66642d757753ba33a928d994cb8a","observation_id":"2dd1e4fc-89a7-4dfb-ae81-19dbfabed34e","resolution":{"observed_at":"2026-08-06T14:06:50.386432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.440650Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.440650Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f402a682d10d3465f8c16d47dd1e749a3d9ffe05a170e1a0b2b10079a462535a","observation_id":"b7b46247-25b2-43e1-ba0c-ab7668f749a5","resolution":{"observed_at":"2026-08-06T14:06:50.440650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.502025Z","title":"Estimation of Non-Normalized Statistical Models by Score Matching","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.502025Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:abd9912f149080d659ade87ac7e4d8be3f55fb6fe798d0e881011cfd41a07ecd","observation_id":"1800086c-2857-4384-b083-9d2aadb9dba0","resolution":{"observed_at":"2026-08-06T14:06:50.502025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-06T14:06:50.559460Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.559460Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:e06e222fb25bd74cc717d1ade84ee058132eb2da3d58575786bd9b288d9bda6b","observation_id":"cea953da-668c-4175-9c08-c80ab35235d1","resolution":{"observed_at":"2026-08-06T14:06:50.559460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.621766Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.621766Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:5cecbaff877828552d91271fb69e6e298d68f521e64bc3dc93891d73491bbbbd","observation_id":"44b46676-4c5a-4f68-b646-af0900b4e165","resolution":{"observed_at":"2026-08-06T14:06:50.621766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.677472Z","title":"Semask: Semantically masked transformers for semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.677472Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:3bd7cf5f362c09607022bc4d1b12cf1cb99383f30c866d1982bc8de0b8a671d3","observation_id":"22c222e9-8c81-42aa-9043-fc9410cc51e5","resolution":{"observed_at":"2026-08-06T14:06:50.677472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.780743Z","title":"Face Perception, chapter 43","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.780743Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:9088f4812fa6a06bfef9fd022936e73d43a24e566a253ac0047031a1d68532ee","observation_id":"c56ffce9-3be8-445d-b81a-23745962c277","resolution":{"observed_at":"2026-08-06T14:06:50.780743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.814693Z","title":"Progressive growing of GANs for improved quality, stability, and variation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.814693Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d9d46fbe8b18ecc8f08c0272b56ee04ddffbdcf6af2a6199e0cf16baf46a85a1","observation_id":"c37d5d5e-056f-4cb1-a791-fb3e7ba5b540","resolution":{"observed_at":"2026-08-06T14:06:50.814693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.860399Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.860399Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7d36c7cd864babc0356c68d5b255ac930411183c6c5cd563b891b4938da0ea53","observation_id":"e65740ff-2e8f-4305-b6a9-30a1c6497c97","resolution":{"observed_at":"2026-08-06T14:06:50.860399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.926567Z","title":"Training generative adversarial networks with limited data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.926567Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a06712dd8bc9c8d1093668c0f24809ef32368d5437ba12e9e5c5a0f4520be04a","observation_id":"0dcf6e1a-a4ab-4a7d-8b86-fd36f8fe6f90","resolution":{"observed_at":"2026-08-06T14:06:50.926567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.959556Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.959556Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:065482872eaaba365fa82c9b74545a5b90a4aeaaf1a5378e05f1ce6ba859bbdf","observation_id":"83060158-189b-44e6-b222-bf5995978336","resolution":{"observed_at":"2026-08-06T14:06:50.959556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.004172Z","title":"Alias-free generative adversarial networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.004172Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7554eb09c5ac18995aa5fb196fe047da0df276b182cfdf3193a3407aa81bb847","observation_id":"c0f67931-2fb2-4881-af8a-da6643180201","resolution":{"observed_at":"2026-08-06T14:06:51.004172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.066428Z","title":"Design amortization for bayesian optimal experimental design","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.066428Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:45d3d320907979a9519a788b2610f7cf29033be729c6fda647456e0a2518c438","observation_id":"122be77e-4532-4630-82b1-02c353f624ef","resolution":{"observed_at":"2026-08-06T14:06:51.066428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.097671Z","title":"Soft truncation: A universal training technique of score-based diffusion model for high precision score estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.097671Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:19f08806d8dc94e3b42fd861698d3bbd864af4894b5d02c843b6f866071181ec","observation_id":"3fac4448-86bd-478d-882a-93e00163f06c","resolution":{"observed_at":"2026-08-06T14:06:51.097671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.102905Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.102905Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:522dc83eb94b2f4eb64f08c0b37a31f57476d884d41fc5d520a6b1aa9d73a608","observation_id":"b401ba84-2259-47dc-b396-97465d0cca7e","resolution":{"observed_at":"2026-08-06T14:06:51.102905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.106085Z","title":"Glow: Generative Flow with Invertible 1x1 Convolutions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.106085Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:94a014082f21de248b9fe3c4e73818be30310c9c29bb17c6050a66160cce4901","observation_id":"b6081e1d-b067-4a68-9003-329d2709e154","resolution":{"observed_at":"2026-08-06T14:06:51.106085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.109144Z","title":"Kingma and Ruiqi Gao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.109144Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:ff86c006063c20e8372289b07469bb79fb93d4bdea06a4ea054dbf9c8aab1672","observation_id":"92d882ff-aa7b-408e-8c1f-0cb7d317e749","resolution":{"observed_at":"2026-08-06T14:06:51.109144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.111982Z","title":"Kingma, Tim Salimans, Rafal Jozefowicz, Xi Chen, Ilya Sutskever, and Max Welling","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.111982Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a998967ce6921a831dfc961cf4fbb4f585759d6be48f9a28a183b03eb16f13f9","observation_id":"a864a28b-96db-4f86-a974-3e4c2c39a478","resolution":{"observed_at":"2026-08-06T14:06:51.111982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.114889Z","title":"Big transfer (bit): General visual representation learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.114889Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:0def62165bc1427688cb0ef45949048f780aa1f6a08c9243f058ce94ebc28d5d","observation_id":"3f450f9e-2b3b-426e-bd59-0ace67173e3b","resolution":{"observed_at":"2026-08-06T14:06:51.114889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.118255Z","title":"Revealing the dark secrets of BERT","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.118255Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:82a429f372a407c67af8207272fe5e1bef9b0fa5900793d1cd7430a3b0c5fb97","observation_id":"aa150093-0620-4e85-b3ca-94a6fb1cb592","resolution":{"observed_at":"2026-08-06T14:06:51.118255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.121028Z","title":"Learning multiple layers of features from tiny images.(2009), 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.121028Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:65c4d976476c93fe5d5bb49a0810e2816601772f94be2655bb07362bacc842c8","observation_id":"8ba03784-9fe4-42c3-9fd4-41d6be1157c3","resolution":{"observed_at":"2026-08-06T14:06:51.121028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.123812Z","title":"The role of imagenet classes in fr´ echet inception distance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.123812Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:1001c94d31dd7dbf821efd789a3c09e35b807589e8db4f9425e7ec2e1bb3005b","observation_id":"34e16a40-0add-4478-9959-b87d89b64cde","resolution":{"observed_at":"2026-08-06T14:06:51.123812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.126557Z","title":"Howard, Wayne Hubbard, and Lawrence Jackel","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.126557Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:01ffbee088b68b31d74391d5924a6ecbcff00f212ed0d02ec408f25dabb73195","observation_id":"6f23a532-41c4-4324-bd4d-6d2df39ca268","resolution":{"observed_at":"2026-08-06T14:06:51.126557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.129391Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.129391Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:440f59151d281e5acd32356edef3491efb7005a408431a7f3508c23feedb6449","observation_id":"6ca5c8df-7dd9-4c9d-b261-e5c3942fb104","resolution":{"observed_at":"2026-08-06T14:06:51.129391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.132239Z","title":"Smooth manifolds","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.132239Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:1fbaf61b219058e60d9e174c04d69f3a7a094c8ee6540dab6795285d00f51990","observation_id":"c8c0bdf2-bb63-4361-9926-1fa0f2ac10a5","resolution":{"observed_at":"2026-08-06T14:06:51.132239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.135213Z","title":"ViTGAN: Training GANs with vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.135213Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8509b35c3f4a2d16219a91fa5ffaa351c32f98f9cd324f4a1002814818656fb9","observation_id":"2a069103-5c3a-4e9f-bdf8-bfd39c349184","resolution":{"observed_at":"2026-08-06T14:06:51.135213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.138356Z","title":"SNIP: SINGLE- SHOT NETWORK PRUNING BASED ON CONNECTION SENSITIVITY","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.138356Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8a2391e6a72d84b3dbc158f74ff389bf2462e6d0f4d49d9eaa0d9c84bf716be8","observation_id":"aaa8493b-b635-4b0f-b43d-caadf969ea35","resolution":{"observed_at":"2026-08-06T14:06:51.138356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.141442Z","title":"xformers: A modular and hackable transformer modelling library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.141442Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7927a5efe2393924b1c94d7bb1dde310656b439292633631ee72757134da6a1a","observation_id":"4e625c77-2414-4e96-ab2f-ad8caa186401","resolution":{"observed_at":"2026-08-06T14:06:51.141442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.144428Z","title":"Demographic bias effects on face image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.144428Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:57c63eadac3e6c6adbef1127a7ae8b52f3135966c4c024ab5f149b86258fcb2a","observation_id":"c4678edd-262e-4ec6-9a39-723df4516573","resolution":{"observed_at":"2026-08-06T14:06:51.144428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.147174Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.147174Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a3f37ae1507b0f36348527ab1e2754610e426d7c5bc55f8dfb0d7c7eb088e08f","observation_id":"08ae80c0-aedf-4df6-a828-0233bd8edae4","resolution":{"observed_at":"2026-08-06T14:06:51.147174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:37:42.345638Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":182},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 182 outbound references and 0 inbound Pith citation observations for arXiv:2507.19795."}