{"as_of":"2026-08-17T13:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49935263e54fa2ac44cd30c61f58e056736fc2c36e7e1b16011fd77d805217e0","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:02:34.906180Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06663/citation-record","integrity":"/paper/2501.06663/integrity","json":"/paper/2501.06663/citation-record.json","paper":"/paper/2501.06663"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.895808Z","title":"When machine learning meets privacy: A survey and outlook,","venue":null,"work_id":"e1f2b0cd-4673-4cab-89ea-ef0b8c769a01","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.621196Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:b9035eb5eaf3dd92700c2fbefdcd1f733dbec212e76c739bf506dbecd2a0fa90","observation_id":"a528b484-22b8-41de-99d1-1cf3a3a99f5f","resolution":{"observed_at":"2026-08-10T21:02:35.900765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.879447Z","title":"Sok: Security and privacy in machine learning,","venue":null,"work_id":"76570314-0a46-42d1-90f5-6ae2dfba1b41","year":2018},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.626111Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:952e4619983cbdf57bbb3fe94d25af39e7a5d95000dcf93d2ff84c58e7651f27","observation_id":"9af989ce-bcda-4c66-86e7-990abe64973a","resolution":{"observed_at":"2026-08-10T21:02:35.884571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.862865Z","title":"DeepReach: a deep learning approach to high-dimensional reachability,","venue":null,"work_id":"4b9be99e-56bf-4930-9bd6-269be77852fb","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.632210Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:cbf93ca8aceaba12c445c0e8f81dca7ca3a78d4a53ef697b174a049b67a0d9ab","observation_id":"88acd6aa-ff43-4df6-b3f2-c448727d7d2b","resolution":{"observed_at":"2026-08-10T21:02:35.867906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.847575Z","title":"A neural network approach applied to multi-agent optimal control,","venue":null,"work_id":"a2ef5981-d8db-4aa3-9b74-fad794a4a028","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.637703Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:3d2912a801c481c66976d797de7400fd750d0934ae2013ac28e97bc9ad666467","observation_id":"c8afabc7-26b1-419a-a5ec-690cedf1334b","resolution":{"observed_at":"2026-08-10T21:02:35.852092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.831776Z","title":"Learning certified control using contraction metric,","venue":null,"work_id":"5e6865d2-2701-4aee-a829-5199d9a04f28","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.642709Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:7d64a473d1e810ea68d4f5738b08c19c5327647e6d7b3c79ba322fa060a70c44","observation_id":"b745b666-7b76-4d58-a007-ecfe8cdfb8d5","resolution":{"observed_at":"2026-08-10T21:02:35.837069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.814522Z","title":"Learning in the wild: When, how, and what to learn for on-device dataset adaptation,","venue":null,"work_id":"80b90fdf-56f6-432e-bf83-f1dc2ff6dd46","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.648811Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:329ce7b032f0a1fc3c285753e089957f524d460544e5defdc93b90b8186e2768","observation_id":"3c3ef8e6-32d0-447f-a720-48282023e1fb","resolution":{"observed_at":"2026-08-10T21:02:35.820269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.795964Z","title":"EF-train: Enable efficient on-device CNN training on FPGA through data reshaping for online adaptation or personalization,","venue":null,"work_id":"ea9b243e-e069-4bf2-a330-6b46d9731e7c","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.655158Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:85ec10bf57bfb2c38fd7d9cd31f6a3486d56ca80f2e22df2ce9e375e8c8c5d1e","observation_id":"1b9b1210-99c6-4a40-8720-67f6e87e5d94","resolution":{"observed_at":"2026-08-10T21:02:35.800945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.779466Z","title":"BOOST: block minifloat-based on-device CNN training accelerator with transfer learning,","venue":null,"work_id":"7ad4d6f4-6c23-47ff-82a4-c23edfc42644","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.660004Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:e01d154e83d63089be49991b6185b9ba5d0bd45169569a778a9263e1c9937429","observation_id":"c9790ef0-9554-4736-9790-3be9fa7cb909","resolution":{"observed_at":"2026-08-10T21:02:35.784812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.763108Z","title":"ETA: an efficient training accelerator for DNNs based on hardware-algorithm co-optimization,","venue":null,"work_id":"70770e59-b88e-4d7a-b3c8-d81eeb67af87","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.665402Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:05afc86dcd0688e8d0e3f0e1566ce3a5b02a78b12335b21414ae00c6371cf8fc","observation_id":"222ec652-2c4b-438a-af1a-6de3c6671924","resolution":{"observed_at":"2026-08-10T21:02:35.768424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.746063Z","title":"Training deep neural networks in low-precision with high accuracy using FPGAs,","venue":null,"work_id":"9adaad0a-258e-4657-ac82-ba590d20c3db","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.670140Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:df603050aa655fd79cd5149155bc7ad1bc0b4cb606c327a0f1bb533b159d6f7f","observation_id":"560807a6-ef4c-4e23-906f-82521fb2e969","resolution":{"observed_at":"2026-08-10T21:02:35.751757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.727558Z","title":"FAST: DNN training under variable precision block floating point with stochastic rounding,","venue":null,"work_id":"438c1e8c-83a5-447a-95b5-2606af180194","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.675239Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:6b1a19700e542325936ff1da9009bf9e273048b319dafa3e8261e1db5e9b4dc3","observation_id":"1c86f4fb-efb4-441e-ba67-0f320166a3c4","resolution":{"observed_at":"2026-08-10T21:02:35.733370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.680780Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.680780Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:cb96bc1eb60a41d81cbb2c53c2e0bc3f138506a1ad3a6385c79c9989f35917fe","observation_id":"f26ca76e-8598-4be8-ae52-2ef688a9c662","resolution":{"observed_at":"2026-08-10T21:02:34.680780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.700384Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"df29997d-48b7-4d28-8523-99b2bd268c8b","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.685425Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:eee78a7699b3a560cd237699b7c3c1f0c5f17edb8955b60629b6d4b53faf6da7","observation_id":"1aad8ddd-8844-4a66-9b52-e00249f87d52","resolution":{"observed_at":"2026-08-10T21:02:35.705501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:02:34.689435Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.689435Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:6a9f5818516e6414e68f52754ebdfc19cdb44d16c7d6c1d55435921e4134b72f","observation_id":"29feb44a-97a5-4208-83e0-b98acbb960f2","resolution":{"observed_at":"2026-08-10T21:02:34.689435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.684530Z","title":"Segment anything,","venue":null,"work_id":"fea00a86-6383-4ddf-b224-f702631ef62a","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.694119Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:863f98ec22341d619ba136bed278688a491616dd1af677907fb7740e7855ec3a","observation_id":"433a0d07-9a39-4714-a2fb-66c1eaa8693d","resolution":{"observed_at":"2026-08-10T21:02:35.689465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.668134Z","title":"PINNsFormer: A transformer- based framework for physics-informed neural networks,","venue":null,"work_id":"42477422-5b83-483b-b68f-811e768e97d3","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.698271Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:6e41c3436d145288c0c6ff314ba446f63ea4fc098d232034afa311140b110da3","observation_id":"9eaed75d-ecba-40f5-834b-8c01c918fbe5","resolution":{"observed_at":"2026-08-10T21:02:35.673202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.650069Z","title":"Federated learning in asr: Not as easy as you think,","venue":null,"work_id":"43278a59-48cd-415a-a5bb-dd3823833e24","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.702459Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:6c36675b045da0f0cc106fd511cf9d86795c662b13804fd1699d5db2e0e7319b","observation_id":"ae96de93-2f5c-4ad9-a2de-f2b488434dc5","resolution":{"observed_at":"2026-08-10T21:02:35.655480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15966","last_updated":"2022-04-05T17:57:30Z","snapshot_observed_at":"2026-08-16T17:10:46.109396Z","submitted_at":"2022-03-30T00:50:16Z","title":"Federated Domain Adaptation for ASR with Full Self-Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15966","snapshot_observed_at":"2026-08-10T21:02:34.706338Z","title":"Federated domain adaptation for asr with full self-supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.706338Z"},"links":{"cited_paper":"/paper/2203.15966","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:34b4a45f373a04a0cd4cdfbe0e1b21c315d4c1bb1a39de5e67fdd844a1b242f7","observation_id":"b7f34a39-681f-4b87-acea-0fce80f52970","resolution":{"observed_at":"2026-08-10T21:02:34.706338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.633358Z","title":"BEBERT: efficient and robust binary ensemble BERT,","venue":null,"work_id":"44769b06-df90-482c-9ece-37022aa37d6d","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.711245Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:a6e3e528eabe967cffcf555fad58f1471bf97ef165f3099b59049fac795e8f06","observation_id":"457e28ed-38f0-4f8e-bad8-703c93d922f1","resolution":{"observed_at":"2026-08-10T21:02:35.638419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11851","last_updated":"2024-01-23T04:17:07Z","snapshot_observed_at":"2026-08-16T16:48:54.707867Z","submitted_at":"2024-01-22T11:14:08Z","title":"BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge","version":2},"cited_work":{"arxiv_id":"2401.11851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.11851","snapshot_observed_at":"2026-08-10T21:02:35.019644Z","title":"BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge","venue":"cs.AR","work_id":"2792a732-eb8f-4082-8461-736c1bb2ad62","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.716955Z"},"links":{"cited_paper":"/paper/2401.11851","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:ea42d924829e7f0c3882d4c2552d325d042fc60ca5eff8a65e51e9ceca62a5be","observation_id":"201f0beb-952d-435f-8d1b-134d2d2ed07d","resolution":{"observed_at":"2026-08-10T21:02:35.025041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.615803Z","title":"Training deep neural networks with 8-bit floating point numbers,","venue":null,"work_id":"cd0b024d-7206-4906-b703-77862a5565f3","year":2018},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.721805Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:2cac13160988f2cdd7ba04000d6aa5ad91790d415077f14207520fcd3699ad72","observation_id":"53268a6c-2bfa-4786-b202-e8dd5ebf3b44","resolution":{"observed_at":"2026-08-10T21:02:35.620937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01076","last_updated":"2023-07-08T04:29:09Z","snapshot_observed_at":"2026-08-16T16:48:51.054029Z","submitted_at":"2023-06-01T18:32:08Z","title":"Quantization-Aware and Tensor-Compressed Training of Transformers for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":"2306.01076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.01076","snapshot_observed_at":"2026-08-10T21:02:34.995125Z","title":"Quantization-Aware and Tensor-Compressed Training of Transformers for Natural Language Understanding","venue":"cs.CL","work_id":"f1274c36-0bb4-45c9-a5e3-65144ca33111","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.726485Z"},"links":{"cited_paper":"/paper/2306.01076","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:08262b8ec38ef48b0d5400575ae48cb13fe708d7dc98f0797f04fa7f27062168","observation_id":"5b8278ff-8f14-4b08-bb71-37e1c3672f58","resolution":{"observed_at":"2026-08-10T21:02:35.002354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.599629Z","title":"LoRETTA: low-rank eco- nomic tensor-train adaptation for ultra-low-parameter fine-tuning of large language models,","venue":null,"work_id":"9a77aa18-763a-48dd-8a81-53e8c5b33392","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.731719Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:2e97dd4554bcbf698a7ccb392bdb73c76ac86a1fb9e40be10d7e09822ffa6a4d","observation_id":"d92fa232-383f-4b18-a693-fe165f333a5a","resolution":{"observed_at":"2026-08-10T21:02:35.605182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.582735Z","title":"AdaZeta: adaptive zeroth-order tensor-train adaption for memory- efficient large language models fine-tuning,","venue":null,"work_id":"625baf45-759c-4453-8471-5f5c4517cc1e","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.736335Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:31515cb40f3d1affa0d215b287a703ed2ba836f9395f41377487fd0d46146af7","observation_id":"d98655cd-cae4-4b81-87a1-43f52b441f17","resolution":{"observed_at":"2026-08-10T21:02:35.588268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.564643Z","title":"An algorithm–hardware co-optimized framework for accelerating N: M sparse transformers,","venue":null,"work_id":"342fcfc8-ffd4-45e1-8d80-319da61778d0","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.740905Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:da7833b0a17ffbec9bfa7385a185d595264d6f359acd7f836760e8e31ff22cb3","observation_id":"ff30906e-4784-4ce0-9e18-36450e02dc32","resolution":{"observed_at":"2026-08-10T21:02:35.569929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.548408Z","title":"Efficient N: M sparse DNN training using algorithm, architecture, and dataflow co-design,","venue":null,"work_id":"223e46ca-477c-45bf-b86c-a895058323ba","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.746477Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:63633d0bde5a66034036fc629409ab0a0c0e9214c0df3cb123fc3ce01330b85a","observation_id":"45151565-c3d7-45dd-b07e-892a0867effa","resolution":{"observed_at":"2026-08-10T21:02:35.554111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.532058Z","title":"MINILM: Deep self-attention distillation for task-agnostic compression of pre- trained transformers,","venue":null,"work_id":"dca9e69d-aedd-40bf-8ef7-d7fed2c1c572","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.751042Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:af3e99004fbb1c51b00b4a1214cd6595fa880e95854de2a980c2cccde3fbb681","observation_id":"7eece556-4698-4c72-b56a-e5a6867cab5d","resolution":{"observed_at":"2026-08-10T21:02:35.537384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.514190Z","title":"Wanda++: Pruning large language models via regional gradients,","venue":null,"work_id":"ebd58d89-625b-49f3-8df7-6588f933d0be","year":null},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.755945Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:5ff1e352a0a20e913a9885bf7bf5533bf18fba84c03c886b5abf05093e472fe2","observation_id":"62622bc6-62d4-4b91-a896-b92258791984","resolution":{"observed_at":"2026-08-10T21:02:35.520222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.497051Z","title":"Compressing dma engine: Leveraging activation sparsity for training deep neural networks,","venue":null,"work_id":"cc9cfbc3-e823-4251-bd75-fc3501fba1b1","year":2018},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.761118Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:5abe5c12f83fffb14b43f6ee3b7e556ada6f613f87aade67a9333ed3dc61ee8a","observation_id":"0dcc4082-d9b2-4a2f-a74d-81c3f96b9d0b","resolution":{"observed_at":"2026-08-10T21:02:35.502722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.765940Z","title":"Quantized neural networks: Training neural networks with low pre- cision weights and activations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.765940Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:b5326ee3063c9df96b40a6cce3500e6d02ce48f7f98d84156eb7d73746b67da8","observation_id":"11406047-74c2-4dec-8000-1a81249c299c","resolution":{"observed_at":"2026-08-10T21:02:34.765940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.469717Z","title":"Deep learning with limited numerical precision,","venue":null,"work_id":"9cc72a98-f1b6-490d-b1fb-ba42671a56f8","year":2015},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.770934Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:eb06c39e7d74cc6925ef34d1eb4f0f4c985c242fe25ad5fe5c983806a9b9b287","observation_id":"cb9ac2de-89c6-42cb-b596-2e677cfb0945","resolution":{"observed_at":"2026-08-10T21:02:35.475381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.453424Z","title":"Ultra- low precision 4-bit training of deep neural networks,","venue":null,"work_id":"5f003c1c-8cae-4be8-b87d-f4c1b1bbceac","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.775666Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:22f4eb8a0ad7554cbb9f37dd29de29357b7a16b35377774df82666a421e55a95","observation_id":"d7362667-e6c8-4998-b561-0d56ff1dec9e","resolution":{"observed_at":"2026-08-10T21:02:35.458527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.780461Z","title":"Tensor decompositions and applications,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.780461Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:85ea712df535cb3cc7c5de2b5ef126b3e05f80307ecae506b6ef378e89cd5f87","observation_id":"771ee7b0-59ad-40c6-99e9-bf8f11d8e090","resolution":{"observed_at":"2026-08-10T21:02:34.780461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.424883Z","title":"Speeding-up convolutional neural networks using fine-tuned cp- decomposition,","venue":null,"work_id":"1236c734-90c0-40b3-92e6-89042a88221a","year":2015},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.784569Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:cdebc4979b6943cb345d5e2e6b3ac7a15fb6e915daffe8d12cf509822428cda8","observation_id":"296d507f-1d22-48c6-987a-8c7719f6e57d","resolution":{"observed_at":"2026-08-10T21:02:35.430776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06530","last_updated":"2016-02-24T11:52:12Z","snapshot_observed_at":"2026-08-14T22:22:04.565322Z","submitted_at":"2015-11-20T09:20:08Z","title":"Compression of Deep Convolutional Neural Networks for Fast and Low Power Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06530","snapshot_observed_at":"2026-08-10T21:02:34.789038Z","title":"Compression of deep convolutional neural networks for fast and low power mobile applications,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.789038Z"},"links":{"cited_paper":"/paper/1511.06530","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:d260808943045c660bed89a1ee86b9f92fc37e05ec15665a888528bd16dcfbee","observation_id":"9602d4be-65ce-4962-bb6e-9ecfb9e2f3ef","resolution":{"observed_at":"2026-08-10T21:02:34.789038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.407548Z","title":"Fast video facial expression recognition by deeply tensor-compressed LSTM neural network on mobile device,","venue":null,"work_id":"0fdc8051-b149-4959-b024-a1039a1f1a06","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.793571Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:8d584aed75a380d0d1ab8f7368170d8272eebd91874a5c6cecb850b487144da3","observation_id":"75f57b58-d873-4cca-bea8-9d6b4f68abd7","resolution":{"observed_at":"2026-08-10T21:02:35.413299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.797827Z","title":"Tensorizing neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.797827Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:196f924472affa15d5b00d0619cd4110e4c05f929a99689c655bd7e69aac32c5","observation_id":"ec34acf0-f02b-4dab-aa08-215738260a02","resolution":{"observed_at":"2026-08-10T21:02:34.797827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.06133","last_updated":"2020-01-06T10:41:42Z","snapshot_observed_at":"2026-08-15T08:40:01.559704Z","submitted_at":"2019-03-14T17:19:38Z","title":"Compression and Interpretability of Deep Neural Networks via Tucker Tensor Layer: From First Principles to Tensor Valued Back-Propagation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.06133","snapshot_observed_at":"2026-08-10T21:02:34.801878Z","title":"Compression and interpretability of deep neural networks via Tucker tensor layer,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.801878Z"},"links":{"cited_paper":"/paper/1903.06133","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:3a4fadc5b3b7bf532ec798663f0b99c94eb0273964fd2461836ee427bc3182d4","observation_id":"7ae86d44-fdf6-4f37-be79-681521f0a82e","resolution":{"observed_at":"2026-08-10T21:02:34.801878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.379550Z","title":"Tensorized embedding layers,","venue":null,"work_id":"3ec204fc-0b2e-4cd5-86f7-f35c0896c570","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.806898Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:efef77ee938c22c1e1aab41d1594afb8a55ec56700d8ba5443220a3a78efc5fe","observation_id":"fd986210-88d2-4823-84ad-cd7a985e039b","resolution":{"observed_at":"2026-08-10T21:02:35.384401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.364334Z","title":"A tensorized transformer for language modeling,","venue":null,"work_id":"2cab60c5-4153-47e8-b102-234d7e18a5a8","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.811317Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:ab1e357c9742e7404498da873b0b8e8d63c5bf6a6ef7b28e8401f936e190ac53","observation_id":"1533a14d-c31f-4feb-8d1e-457bf8b41757","resolution":{"observed_at":"2026-08-10T21:02:35.369241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.348017Z","title":"TIE: energy- efficient tensor train-based inference engine for deep neural network,","venue":null,"work_id":"37e91eee-3e40-4618-9c70-a6d95ed11921","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.815771Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:72fb6618128311ba2dd68754c3c0caea58783917d75b7ea0324a28e1178c8753","observation_id":"eb7b8697-aa6d-4699-a0bd-2b0b95f473b9","resolution":{"observed_at":"2026-08-10T21:02:35.353610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.332041Z","title":"ETTE: Efficient tensor-train-based computing engine for deep neural networks,","venue":null,"work_id":"b41f136c-3384-4226-8d7f-cb91d9ef6f25","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.820252Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:a2a1c9ab4b2e5c792272a07b072c252d33caeb8c8da6e32bfab51c9da3f3c841","observation_id":"f5569ca4-54fa-404b-89f4-90bf425e5a61","resolution":{"observed_at":"2026-08-10T21:02:35.337043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.315818Z","title":"TT-CIM: Tensor train decomposition for neural network in rram-based compute-in-memory systems,","venue":null,"work_id":"81adf333-03af-41c3-beba-9d975c771af2","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.824858Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:25b55969ffb9cc09d073ec7db839b09ac213ce7815a9ae600d3e230d685fbdfd","observation_id":"10e84211-9999-45b6-97d1-9f890d0e4298","resolution":{"observed_at":"2026-08-10T21:02:35.320717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.299196Z","title":"15.4 a 5.99-to-691.1 TOPS/W tensor-train in- memory-computing processor using bit-level-sparsity-based optimiza- tion and variable-precision quantization,","venue":null,"work_id":"0e2407e8-fe81-40da-ac18-65ce7365dfd1","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.829680Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:e17457f8c235fb2043b313c590b23b9cdcb199a3936b1273b8c57ab3cfbbcd08","observation_id":"74892902-0616-4bf2-8e3b-06ea6f009722","resolution":{"observed_at":"2026-08-10T21:02:35.304332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09858","last_updated":"2023-10-09T18:00:00Z","snapshot_observed_at":"2026-08-16T15:07:24.442835Z","submitted_at":"2023-08-18T23:56:50Z","title":"Tensor-Compressed Back-Propagation-Free Training for (Physics-Informed) Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09858","snapshot_observed_at":"2026-08-10T21:02:34.835075Z","title":"Tensor- compressed back-propagation-free training for (physics-informed) neural networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.835075Z"},"links":{"cited_paper":"/paper/2308.09858","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:d9a9b92a187b09d457beeabb555f2636616fc57f5f1019dc64ece299b564b0da","observation_id":"e3fff906-6096-47df-ad95-f3b2bf22f713","resolution":{"observed_at":"2026-08-10T21:02:34.835075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.283608Z","title":"Tensorized optical multimodal fusion network,","venue":null,"work_id":"f1f12c64-202c-4318-b39c-13a7150843fe","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.839943Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:fe18d9de1594dd90f2022b306ea2cb670f40ed3c71ccbb50154e1b388046a62e","observation_id":"e476048e-7405-4180-88bb-dad5d61f9f07","resolution":{"observed_at":"2026-08-10T21:02:35.288931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.266472Z","title":"Real-time fj/mac pde solvers via tensorized, back- propagation-free optical pinn training,","venue":null,"work_id":"89a15ba2-2d05-41ec-b3a3-ad832d7d4cf4","year":null},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.845661Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:7c14be70e6444757765cb794163d8f0d5a5d51268f1173a74da1ee09186eb31d","observation_id":"760367ca-702b-4081-98ce-9fadeb891b15","resolution":{"observed_at":"2026-08-10T21:02:35.271957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.250956Z","title":"The ATIS spoken language systems pilot corpus,","venue":null,"work_id":"22f10c05-fa3c-4b27-a618-cb1b6fbc2666","year":1990},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.850857Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:97f6be820876db794c06cd46f786adbc351e644a47d715bb563c2cb3320354fe","observation_id":"4977035e-3445-4fcd-8817-9bdf888cdefb","resolution":{"observed_at":"2026-08-10T21:02:35.255993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.855807Z","title":"Tensor-train decomposition,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.855807Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:baf05ba1b4b2817ac525df018b7d7b3d6f360b0ce7b3f789dfc0aeaa556dc851","observation_id":"787095f8-228b-43dd-ab3b-e935d0306018","resolution":{"observed_at":"2026-08-10T21:02:34.855807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.225398Z","title":"Tensor-train recurrent neural net- works for video classification,","venue":null,"work_id":"ae70babe-52b1-477b-9934-b9aa7944e3a2","year":2017},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.860510Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:5d0f40f1d221373bc8e635a18bf495e30e38c3d333eac16ee42a87545c887ee6","observation_id":"84beec9b-31e1-4cc9-857f-1e28901aae08","resolution":{"observed_at":"2026-08-10T21:02:35.230465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.210319Z","title":"Learning compact recurrent neural networks with block-term tensor decompo- sition,","venue":null,"work_id":"d5cfd755-8b94-423e-8477-f24e149faf52","year":2018},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.865236Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:0b91ea83fa48194e39fe76d39d2400261864c4d85bdc85722b276a90e6cafa1e","observation_id":"f6012b34-4f7d-441d-a7cd-af7b8c441173","resolution":{"observed_at":"2026-08-10T21:02:35.215107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.194936Z","title":"Towards compact neural networks via end-to-end training: A Bayesian tensor approach with automatic rank determination,","venue":null,"work_id":"b44c9b56-faf2-4104-ab2e-86028b0c8a0f","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.870400Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:e11f6138baf2b4c308d0f98098b48f83cd2e8584e36c8f7f8f5cb83a617525de","observation_id":"0808fd52-35a3-4acd-be49-6e3a8b198d0c","resolution":{"observed_at":"2026-08-10T21:02:35.199924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.180450Z","title":"Bayesian tensorized neural networks with automatic rank selection,","venue":null,"work_id":"0311caef-1f0e-4903-8c4d-8fc56678cfb4","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.875116Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:ac65595ce5908fc9812d378b689c0ec7d34831fff3b49fecf9e41165a4e2eb33","observation_id":"3cb058de-3320-459c-86b2-e51f08f14a82","resolution":{"observed_at":"2026-08-10T21:02:35.184999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.165449Z","title":"Compressing 3D CNNs based on tensor train decomposition,","venue":null,"work_id":"abcec6e9-f69f-46be-ad94-378540ce3b25","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.879762Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:ea2d480e19bd3a911965ac9a7d04b89a59c18de17c8999aadef64459e5551c85","observation_id":"8b321dcc-e70b-469d-8449-ac5f6d2f3161","resolution":{"observed_at":"2026-08-10T21:02:35.170445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.148282Z","title":"Nonlinear tensor train format for deep neural network compression,","venue":null,"work_id":"ee92d001-9f1c-4069-96cb-07c5e308c1af","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.884097Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:ce08b5cb0ad70b6d9302b9bf955885f6a0a2a7bedcdd43aa628babbd5ddbed0b","observation_id":"c2f7b994-8d20-4ea8-827a-0ec5374e1923","resolution":{"observed_at":"2026-08-10T21:02:35.154340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.132070Z","title":"CoMERA: Computing-and memory-efficient training via rank-adaptive tensor optimization,","venue":null,"work_id":"40177f99-2855-4f30-bfe2-a71e68236cfd","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.888393Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:976cb7499dcb05644d2949877046680fad46f25cbda0a1c9081c4e90ad9f30e1","observation_id":"a07ed29c-6697-4acd-8162-6332b808ec5c","resolution":{"observed_at":"2026-08-10T21:02:35.136889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.116224Z","title":"An FPGA-based processor for training convolutional neural networks,","venue":null,"work_id":"64801730-0f57-43d5-b01a-f36b6fd24901","year":2017},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.892435Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:b98ca2306c1de426025b63d48718fa465d2e8d10264f8c9b153a455acf04c389","observation_id":"d0fd9345-174b-4ce1-b0da-e0f801bac2b1","resolution":{"observed_at":"2026-08-10T21:02:35.121361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.100576Z","title":"Automatic compiler based FPGA accelerator for CNN training,","venue":null,"work_id":"f7a8417f-42d5-46b5-8080-cc9193006218","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.896674Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:7b83383751b13b62ea532a11ec2a136b12a1ec6167b59646ee9171fdf6774217","observation_id":"1505b83c-b241-4ee2-ba12-8d8c38345706","resolution":{"observed_at":"2026-08-10T21:02:35.105553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.084972Z","title":"FPGA-based low-batch training accelerator for modern CNNs featuring high bandwidth memory,","venue":null,"work_id":"a99a6271-3468-4586-ad06-cddd4891eeb7","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.901239Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:43385860349fcce6c375d4b273498d17868ac98a4d1815979f20cc248b93bfd9","observation_id":"c563c2d9-fcea-4869-b147-b062f291e149","resolution":{"observed_at":"2026-08-10T21:02:35.089897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.070456Z","title":"for leadership in research and development on circuits and processes for the evolution of microprocessors","venue":null,"work_id":"57acfd1f-da56-449c-8672-39e5d1ce86ea","year":2009},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.906180Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:5761d8c55635cde22f14a8648aa9e20a3167d3722b5e1c30e64b3572e6892b4c","observation_id":"1ed1fc16-e507-47e4-9e6e-f0eafa3719ba","resolution":{"observed_at":"2026-08-10T21:02:35.075105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T01:34:59.729724Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2501.06663."}