{"as_of":"2026-08-23T23:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52a74cf9779e677ccba4420b6aea3955df094fc330b4d8c98cc70ce6aa75b11b","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:19:29.941556Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T15:10:00.146694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T15:10:05.816056Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2412.16822","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16822","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Layer- and timestep-adaptive differentiable token compression ratios for efficient diffusion transformers","venue":null,"work_id":"8bd455ee-0dec-4ceb-a7ce-bc972e8905ad","year":2024},"citing_paper":{"arxiv_id":"2603.06351","last_updated":"2026-05-07T16:40:07Z","snapshot_observed_at":"2026-08-11T15:47:08.117539Z","submitted_at":"2026-03-06T14:59:11Z","title":"DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T15:10:00.146694Z"},"links":{"cited_paper":"/paper/2412.16822","citing_paper":"/paper/2603.06351"},"observation_digest":"sha256:7a6a48ee824969e09d296c4dd9831548ddbc0a12944de9d8371839c154d1624d","observation_id":"416a6da0-af1f-4331-8737-fec204e8b8ed","resolution":{"observed_at":"2026-05-15T15:10:05.819805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16822/citation-record","integrity":"/paper/2412.16822/integrity","json":"/paper/2412.16822/citation-record.json","paper":"/paper/2412.16822"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.520604Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":"d14230e9-9fc0-49b9-98be-80395205bf21","year":2023},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.719073Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:a42e3f946a0d26c28f3d0820468e0c8cbd50c3388e73ea0c974aa1fd8c9f5e0f","observation_id":"ebbc3e73-5ed1-4838-b804-c21660e94ee2","resolution":{"observed_at":"2026-08-11T10:19:30.525018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.723755Z","title":"Token merging for fast sta- ble diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.723755Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:ea43572fc63013d9504cc6db07b9e614bd6a49ae38734b309cebf0f59148bdfe","observation_id":"d81689af-b793-481a-81f9-affc20d295ca","resolution":{"observed_at":"2026-08-11T10:19:29.723755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T10:19:29.728288Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.728288Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:68f40ddc0c42358ddc92910ac35e2254e59c3460c75f2da2047eaf98eea11140","observation_id":"b0a1168b-6d85-4d2c-bfd6-c2cdcd66bbb3","resolution":{"observed_at":"2026-08-11T10:19:29.728288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-20T12:02:18.410348Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-11T10:19:29.732653Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.732653Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:2ae0b0e0ceeaae34d71d54af0b5a0b937f30aad15049d84e96f325fb0030b049","observation_id":"8be5aada-a0be-43f3-9c43-c27a89fc7fcc","resolution":{"observed_at":"2026-08-11T10:19:29.732653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.500229Z","title":"Diffrate: Differentiable compression rate for efficient vision transformers","venue":null,"work_id":"4b22f3cb-cc83-4803-b94e-ed8f19cd59e8","year":2023},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.736447Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:62b2c7e6208729bef0a1cbec57f60138f4901b2433484d8920754e94fe5f7216","observation_id":"79de1df7-647a-40cb-9785-91e1dade57a0","resolution":{"observed_at":"2026-08-11T10:19:30.504845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.488742Z","title":"Model compression and hardware acceleration for neural networks: A comprehensive survey","venue":null,"work_id":"4644054a-ed73-4bd8-a0ca-c7a7709c2c2e","year":2020},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.740371Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:05601218f694cc822d431f783957574216b161a4b80ff4e2b1a5a2a746d7ad94","observation_id":"912cf782-2953-4b88-9eed-801d39e0114a","resolution":{"observed_at":"2026-08-11T10:19:30.493082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.743859Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.743859Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:375a7c2c93599487b0dd2bbcf1ba20ebb48ab5af9174e6fed897ce38fe3b6408","observation_id":"98f017d1-6969-46e2-b503-325b2ea7f70f","resolution":{"observed_at":"2026-08-11T10:19:29.743859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.469285Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"52646ddd-68cb-4303-9cb1-966d9584ac1c","year":2020},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.747694Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:49573df59544a72dcd02db2fa803c1786943f3c60e81f515cfd7180bce52e96f","observation_id":"0a17822d-3b8a-47ae-8b9b-8121d578c557","resolution":{"observed_at":"2026-08-11T10:19:30.474145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.456411Z","title":"Structural pruning for diffusion models","venue":null,"work_id":"c4c0bc3b-a29b-46ee-ae68-fdf0914770f6","year":2023},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.751412Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:2bea2eddee005b14709b08a3e1693cb83dd5da62de1f4c03bfbf74fb50368b3c","observation_id":"bda2a9a4-0727-496c-8665-68b5cebb1393","resolution":{"observed_at":"2026-08-11T10:19:30.461308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T10:19:29.754665Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.754665Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:848809e289679ff499eadcd3a12e9b536c0b8f679e6657689a91a05f4bcd41a8","observation_id":"b89da4e1-cee5-417d-860b-7992339cd277","resolution":{"observed_at":"2026-08-11T10:19:29.754665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.758610Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.758610Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:2fd19ec1bd25bf30548ef06dd4f3c8c13ee266ae327ef82604037159a9d9bc07","observation_id":"d517559c-c93f-40f1-87bb-c8d967b9b0d1","resolution":{"observed_at":"2026-08-11T10:19:29.758610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T10:19:29.762349Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.762349Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:b769b264b4b9fabe15d5763b492210c57fc8b88a05ac449d51430befb170a01b","observation_id":"eef887ff-19fc-43df-bd99-4a02a449a44c","resolution":{"observed_at":"2026-08-11T10:19:29.762349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.766353Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.766353Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:517c15c142a508146dde0e18fa7b77324c3ccb7a5a307def8ebaae0e97e65f8b","observation_id":"785dfbd3-487a-4862-bb8f-b4083d97bf3b","resolution":{"observed_at":"2026-08-11T10:19:29.766353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09844","last_updated":"2018-06-07T14:39:29Z","snapshot_observed_at":"2026-08-18T16:26:39.664825Z","submitted_at":"2017-03-29T00:19:20Z","title":"Multi-Scale Dense Networks for Resource Efficient Image Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.09844","snapshot_observed_at":"2026-08-11T10:19:29.769516Z","title":"Multi-scale dense networks for resource efficient image classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.769516Z"},"links":{"cited_paper":"/paper/1703.09844","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:ab5dc9c59887026c5a007ff80bb6f234d011faac824c8b4f09f23e71da4e40c8","observation_id":"1be7ddc2-69bf-4a59-ae3d-b180ec2bff3e","resolution":{"observed_at":"2026-08-11T10:19:29.769516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.431520Z","title":"Distilling diffusion models into condi- tional gans","venue":null,"work_id":"498159bd-78d2-41fd-b092-fa90a8690172","year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.773853Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:cb2dfff874db0fa67fc0e1f394b9345e9e76de3f59b205571e39c45dda1cfe9c","observation_id":"503cefdd-ef8a-47ec-82bc-a9f9056a12a6","resolution":{"observed_at":"2026-08-11T10:19:30.436031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.777857Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.777857Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:834ee696aade649bfb58bb4155933de750023e358254fae72c605a735f2ba663","observation_id":"6513af6d-518b-4b20-b72c-53ce87cd1222","resolution":{"observed_at":"2026-08-11T10:19:29.777857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15798","last_updated":"2024-12-02T12:58:23Z","snapshot_observed_at":"2026-08-20T06:10:40.663669Z","submitted_at":"2023-05-25T07:28:28Z","title":"BK-SDM: A Lightweight, Fast, and Cheap Version of Stable Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15798","snapshot_observed_at":"2026-08-11T10:19:29.781983Z","title":"Bk-sdm: A lightweight, fast, and cheap ver- sion of stable diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.781983Z"},"links":{"cited_paper":"/paper/2305.15798","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:cf06e267377811c63f1c2f0dd96ba81a9cd93d0b60e1c17482ae620d08fa4cf4","observation_id":"7ccf4c35-c86d-45ff-b4cd-c8bd90eb9ccf","resolution":{"observed_at":"2026-08-11T10:19:29.781983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.786396Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.786396Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:08ba2fb69f370cdc7790cbc8d9a8cb8ccc2cda9bbb11874a3c7ef3f2e7b67cbb","observation_id":"919043a1-1882-470a-b7e2-bc4a7650dbe2","resolution":{"observed_at":"2026-08-11T10:19:29.786396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02747","last_updated":"2025-02-26T10:49:33Z","snapshot_observed_at":"2026-08-16T14:03:56.951368Z","submitted_at":"2024-04-03T13:44:41Z","title":"Faster Diffusion via Temporal Attention Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02747","snapshot_observed_at":"2026-08-11T10:19:29.789872Z","title":"Faster diffu- sion via temporal attention decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.789872Z"},"links":{"cited_paper":"/paper/2404.02747","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:4176f84ecb827f522dd45f107bb96b59ea795f385b2629737cab70612e895786","observation_id":"651f29b3-5412-4ec5-96bb-7ddd2343836d","resolution":{"observed_at":"2026-08-11T10:19:29.789872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.407745Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"3feec07a-98f2-4d23-9a06-8972cf0eb5c0","year":2019},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.793408Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:7ad48fcbac396d7245c13b64c231d0a0cb99bfff287140779838fd68be50bad9","observation_id":"2ecfe594-ed7d-416d-8647-64f6732baa9a","resolution":{"observed_at":"2026-08-11T10:19:30.412034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.395520Z","title":"Dpm-solver: a fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":"0dbf85a1-9d32-4ec5-a43e-f77cd226db1a","year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.796843Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:dbcf3260e9cca2934d4faf5d85f0d9136b84f84dfcc2aef2b639541cf76a0bb2","observation_id":"429ed189-f1bb-4a08-86bd-274e50711012","resolution":{"observed_at":"2026-08-11T10:19:30.400426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01733","last_updated":"2024-11-16T07:43:28Z","snapshot_observed_at":"2026-08-16T14:54:16.987293Z","submitted_at":"2024-06-03T18:49:57Z","title":"Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01733","snapshot_observed_at":"2026-08-11T10:19:29.800222Z","title":"Learning-to-cache: Accelerating diffusion trans- former via layer caching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.800222Z"},"links":{"cited_paper":"/paper/2406.01733","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:fb4d84d383bdbcea8ea3e0fa0490e8bf7b8495e44d4bd493920b448e67518633","observation_id":"14dadf01-8d5f-4fb4-80df-21de457fa0bc","resolution":{"observed_at":"2026-08-11T10:19:29.800222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.384353Z","title":"On distillation of guided diffusion models","venue":null,"work_id":"b80848dd-959c-4068-9e2d-9eb27dc7a3f7","year":2023},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.803541Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:00c5cf903f32ce3ad762cd8631dcb70454f4a39c4dac7921eaf59c19ecf1974b","observation_id":"77746eb2-aeed-4195-95b9-3b17f3aff3ef","resolution":{"observed_at":"2026-08-11T10:19:30.388750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.373404Z","title":"Early exiting for acceler- ated inference in diffusion models","venue":null,"work_id":"33c4590d-20dd-45cc-9625-62d7d6c8280f","year":2023},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.807717Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:adcebb98c357267e6847fcd0d3b7c2bd490e42466192a1006c58763acb2453c0","observation_id":"afd40078-6e9d-42f4-b8f7-ae00a8583baa","resolution":{"observed_at":"2026-08-11T10:19:30.377069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.362706Z","title":"Cache me if you can: Effects of dns time-to-live","venue":null,"work_id":"be068081-cbd6-4681-9395-0272b9b0ffb7","year":2019},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.811297Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:cd3cffd49a5b8de936280bef8a8039b055d206b130e360b42d753be6c9cc2bcd","observation_id":"89e95efa-02aa-405b-a05e-0bd99a54944d","resolution":{"observed_at":"2026-08-11T10:19:30.366364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.350837Z","title":"Hydranets: Specialized dynamic archi- tectures for efficient inference","venue":null,"work_id":"1e8c8811-d4c9-475b-a506-4788f0fe08db","year":2018},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.815476Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:a6169fd64754fb3fdfdcad0e1b0516fd217726dbf5e88898ec44591c2edf2b5f","observation_id":"b37b2d60-be7f-47ed-8d89-316571c9d115","resolution":{"observed_at":"2026-08-11T10:19:30.355313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.338785Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"c6f5e5e6-697e-4aa2-9ff4-6570ba57c04b","year":2021},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.819599Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:2b20bcfa4c7350d38ac41ebd0384c31c3bafb42683a6f76b7ce92269c71dac85","observation_id":"de4690be-6d13-4178-8fb2-0a69714f2467","resolution":{"observed_at":"2026-08-11T10:19:30.343434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12382","last_updated":"2024-04-18T17:59:27Z","snapshot_observed_at":"2026-08-20T06:10:34.597207Z","submitted_at":"2024-04-18T17:59:27Z","title":"Lazy Diffusion Transformer for Interactive Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12382","snapshot_observed_at":"2026-08-11T10:19:29.823420Z","title":"Lazy diffusion transformer for interactive image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.823420Z"},"links":{"cited_paper":"/paper/2404.12382","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:d70e1e546213a198bbd1d66241ca7286f9f1d429aed767f84766730517336f2a","observation_id":"0141d69a-1e41-496d-8c23-40bcddf4c890","resolution":{"observed_at":"2026-08-11T10:19:29.823420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.827736Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.827736Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:a67712820f26bb6380c7959d1b9e8b173a7b49f519fb94fbc0d4b39fd96f0f49","observation_id":"0475ad0c-2e9f-482f-8d11-8ae19f1639e3","resolution":{"observed_at":"2026-08-11T10:19:29.827736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T10:19:29.831150Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.831150Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:c569cc404accdaca827fd67181521a3a4b52906cbb953d0d4375685212c6ac45","observation_id":"baf5a7fb-4163-4caf-9fcf-b08adecd0689","resolution":{"observed_at":"2026-08-11T10:19:29.831150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05710","last_updated":"2024-08-11T07:01:39Z","snapshot_observed_at":"2026-08-20T06:10:39.505851Z","submitted_at":"2024-08-11T07:01:39Z","title":"Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators","version":1},"cited_work":{"arxiv_id":"2408.05710","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.05710","snapshot_observed_at":"2026-08-11T10:19:30.058581Z","title":"Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators","venue":"cs.CV","work_id":"a8100755-4da5-4601-9d07-ad1af47955ea","year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.834692Z"},"links":{"cited_paper":"/paper/2408.05710","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:0c4f78a77bee8a6ee9247c4c26b8aac1936c0a2f2ab8480d0f055b8a264912bc","observation_id":"a4094fbc-4424-45c6-8723-2deeeb0a507f","resolution":{"observed_at":"2026-08-11T10:19:30.064145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.837971Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.837971Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:02acc382b96648ee67fa5cf89639750d4b9c791207fd3a3a702127cf056af151","observation_id":"503e79ac-a328-42b2-9939-e323d17a8dcf","resolution":{"observed_at":"2026-08-11T10:19:29.837971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-21T19:20:25.456685Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-11T10:19:29.841358Z","title":"Mixture-of-depths: Dynamically allocating com- pute in transformer-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.841358Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:133a2aad74305bf00ed1671ea02f1bc4ab55494507e5505b6bd344289b151b33","observation_id":"80d1bcf4-8648-45b6-8ae3-2ca5fe86240d","resolution":{"observed_at":"2026-08-11T10:19:29.841358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.844852Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.844852Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:e6170fc5652b424e29bf394b52dfc64b14ce62d5b36904cc5f1610ccaa9b7feb","observation_id":"426bafbd-06fb-4ef7-9f50-3c9fd828bbd1","resolution":{"observed_at":"2026-08-11T10:19:29.844852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-23T22:03:56.253861Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-11T10:19:29.848351Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.848351Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:810fe81f81b500a5b010f68d6b4a86e79aac6bf7363684ca1ccc7c68849d2867","observation_id":"e5f5b23c-6a0b-43c1-ba03-c4255fa1a928","resolution":{"observed_at":"2026-08-11T10:19:29.848351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.851986Z","title":"Adversarial diffusion distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.851986Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:9ea3131f2013ad1fed1c429b60671a0b1c7bbeef21658d3acc26d0fe2ed0bae6","observation_id":"9e8c37ed-06fe-4b15-b98c-a8d3120f0fb2","resolution":{"observed_at":"2026-08-11T10:19:29.851986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T10:19:29.855718Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.855718Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:083bf1b17d576184cfe54cc3bd6a204b0b94436bf79787f1cbeb6e55084506f7","observation_id":"f168f87b-5e6e-421e-8616-36273c0f5ef0","resolution":{"observed_at":"2026-08-11T10:19:29.855718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.305567Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"f102d4df-7409-4cbc-b876-949150e83a93","year":2022},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.859178Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:af5a1b9eb27c5d1c5c40b5c10a700ebf08dbc03bfdf1642befd6c23594f92d87","observation_id":"4c079068-dbd0-49e6-8284-3745a8c66e62","resolution":{"observed_at":"2026-08-11T10:19:30.309186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13573","last_updated":"2024-05-08T05:09:48Z","snapshot_observed_at":"2026-08-20T06:10:35.118105Z","submitted_at":"2024-02-21T07:10:28Z","title":"ToDo: Token Downsampling for Efficient Generation of High-Resolution Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13573","snapshot_observed_at":"2026-08-11T10:19:29.862542Z","title":"Todo: Token downsampling for efficient generation of high-resolution im- ages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.862542Z"},"links":{"cited_paper":"/paper/2402.13573","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:5897228c9ad09f3656de82404e7b066bed03a00558daab60d7e6bf6c469f0059","observation_id":"5efc1f43-ba81-40bc-9119-03f4b09125b7","resolution":{"observed_at":"2026-08-11T10:19:29.862542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.866320Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.866320Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:ff303a0a83f0e09d10bb7b8e8d23a72692eb8aa08ce321b28c1712f633a36e86","observation_id":"06e366d5-df8a-4e78-9f4b-718e4d947ed6","resolution":{"observed_at":"2026-08-11T10:19:29.866320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T10:19:29.869594Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.869594Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:ab857754fb615b8e042db7c57c43f85594e488fb53142e7997f157ffc0dd4451","observation_id":"16dda16c-ef06-4dd6-a760-08c771a4b285","resolution":{"observed_at":"2026-08-11T10:19:29.869594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.289853Z","title":"Branchynet: Fast inference via early exiting from deep neural networks","venue":null,"work_id":"dae91779-2666-47a8-9f45-3ce335abde12","year":2016},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.873790Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:4327735af6b50b2629f95df91c601f2b9cbecf16ebca7e924dae400d7e0e9cbd","observation_id":"6eeaa2e1-840e-45a2-a607-12bf8395dcbc","resolution":{"observed_at":"2026-08-11T10:19:30.293300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.878058Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.878058Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:d45ad8c415fd66fec7113a5a5aa81fe8f4c90e4a9bbd8b5c33fefceebe38fd17","observation_id":"33a0fec6-cfec-44f5-b629-85a049999f81","resolution":{"observed_at":"2026-08-11T10:19:29.878058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.882004Z","title":"Diffusers: State-of-the-art diffu- sion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.882004Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:68a06a5ddac23cff49fb96947833f2c181f3ac6142e52850d46ee47c841c90bf","observation_id":"0bc5eaee-be30-4723-8e06-491955fa4e90","resolution":{"observed_at":"2026-08-11T10:19:29.882004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.268832Z","title":"Attention-driven training-free efficiency enhancement of diffusion models","venue":null,"work_id":"fd573249-d687-49a9-b9d6-21cc9475f2ea","year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.885257Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:a68ebf65fec36c9141537925077ba7f1f4bcd847555514dffda1df97d191a575","observation_id":"258589c3-0c16-411e-9bea-0624276416ca","resolution":{"observed_at":"2026-08-11T10:19:30.272389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17403","last_updated":"2025-03-25T08:38:28Z","snapshot_observed_at":"2026-08-19T03:33:51.534145Z","submitted_at":"2024-05-27T17:51:36Z","title":"A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17403","snapshot_observed_at":"2026-08-11T10:19:29.888841Z","title":"A closer look at time steps is worthy of triple speed-up for diffusion model training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.888841Z"},"links":{"cited_paper":"/paper/2405.17403","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:85530b50d538ce6901d4417666419dd93a338e97509dbff93585ede5b607b63e","observation_id":"39c5fb13-4cc5-49ca-b3ca-ebc05602107d","resolution":{"observed_at":"2026-08-11T10:19:29.888841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.258796Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided im- age inpainting","venue":null,"work_id":"32fec622-1203-4872-9487-6604f0a4128c","year":2023},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.892370Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:c5c9198cf051daa403e00d8c1ba6ae33d9c029fea91c09274033ef9f059222b0","observation_id":"a4fd9c29-eed4-4f99-99a8-a336f83aaba6","resolution":{"observed_at":"2026-08-11T10:19:30.262567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:29.895782Z","title":"Skipnet: Learning dynamic routing in convolutional networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.895782Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:c6ad7bbebf9c14845842946a9f5b87068dbafebbfc1684aeadb61d01547035b3","observation_id":"8f0edd99-33ad-49ac-97e2-4e291111d53e","resolution":{"observed_at":"2026-08-11T10:19:29.895782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.243009Z","title":"Dual dynamic inference: Enabling more efficient, adap- tive, and controllable deep inference","venue":null,"work_id":"a7f1ab9e-befc-4919-8844-4408c0c84815","year":2020},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.898972Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:894bd1bbdb278c6eb117ef4e3e5eb9ea2d7cb33c20dd43a6d25a655e78d47870","observation_id":"d6606519-f20d-434e-a6ba-e20cf580d6a5","resolution":{"observed_at":"2026-08-11T10:19:30.246935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.232138Z","title":"https : / / github","venue":null,"work_id":"90deeef0-9fb7-4c16-8bf1-bf8dfc80d5f4","year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.902284Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:913d446bd17b86c9c24c840aa8b3614d5fa0326a633021737cbe3a20535ad530","observation_id":"fc802f1e-dfbd-4c5a-ad9f-43a8772be5b1","resolution":{"observed_at":"2026-08-11T10:19:30.235632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-11T10:19:29.910760Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.910760Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:800d3c7d5070676a9648d615409ba46cf8ac88b5501504a3ac0812b6587dda0f","observation_id":"5fcd236f-533d-404d-84c8-0adcf75831c1","resolution":{"observed_at":"2026-08-11T10:19:29.910760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.210929Z","title":"Blockdrop: Dynamic inference paths in residual networks","venue":null,"work_id":"5b273521-8fe5-4aa6-9038-46f2b88da1f0","year":2018},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.915413Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:4167f5fd4c2cf53f089313ed6ef312da17eb35e564dd0f5227fda40490cbe2a7","observation_id":"aa16123b-0b75-4507-be32-5169d40332da","resolution":{"observed_at":"2026-08-11T10:19:30.214344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.200552Z","title":"Smartbrush: Text and shape guided object inpainting with diffusion model","venue":null,"work_id":"54b448b2-02e0-4079-b78d-a42ab332425b","year":2023},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.919587Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:63de6cfb7bb3d9c0032265c2ddedcc1bbb8bef25d3e88092610d9b3bd38ed4b3","observation_id":"6dbdc0e0-f6fb-4c7f-af43-b15c3e28debe","resolution":{"observed_at":"2026-08-11T10:19:30.203984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.189282Z","title":"Deepcache: Principled cache for mo- bile deep vision","venue":null,"work_id":"14fadef4-9f01-4759-bdff-7853e7567367","year":2018},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.922986Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:aba6a2f7555c9b3d1440362980d127cb1dfc0248da9470d6d37eac9c226cd777","observation_id":"df162457-6804-4737-a2b8-2195d6e0e9f8","resolution":{"observed_at":"2026-08-11T10:19:30.192917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14867","last_updated":"2024-05-24T17:08:32Z","snapshot_observed_at":"2026-08-19T20:05:57.346957Z","submitted_at":"2024-05-23T17:59:49Z","title":"Improved Distribution Matching Distillation for Fast Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14867","snapshot_observed_at":"2026-08-11T10:19:29.926869Z","title":"Im- proved distribution matching distillation for fast image syn- thesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.926869Z"},"links":{"cited_paper":"/paper/2405.14867","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:14756e9283525af89926ec29ba9c94078eb73646b3d5142a90554e53458d9384","observation_id":"554d4e5d-7984-436b-87a9-38f39b3478ef","resolution":{"observed_at":"2026-08-11T10:19:29.926869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.178565Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":"46f791c8-8d37-4f91-827b-f8106ed43f2a","year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.930751Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:290e86f2dea95d3af57e64c70f91da985038c200720a5577fa0e338033e85d27","observation_id":"d697ca8b-bee2-4c14-a7e9-eeaec51df75d","resolution":{"observed_at":"2026-08-11T10:19:30.182657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.167710Z","title":"Not all tokens are equal: Human-centric visual analysis via token clustering transformer","venue":null,"work_id":"a817ab73-6c96-48a4-8732-2f29031b8f54","year":2022},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.934075Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:5b5fe70aa3d16e3fda95907ac05e98d5f467b2d42188384a4257d0deab374cab","observation_id":"94277dbe-e238-40db-b542-465abc75524b","resolution":{"observed_at":"2026-08-11T10:19:30.171362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03456","last_updated":"2024-10-09T01:01:34Z","snapshot_observed_at":"2026-08-18T22:16:12.132549Z","submitted_at":"2024-10-04T14:14:28Z","title":"Dynamic Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03456","snapshot_observed_at":"2026-08-11T10:19:29.937840Z","title":"Dynamic diffusion transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.937840Z"},"links":{"cited_paper":"/paper/2410.03456","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:435f1b37032c56ca4c582c6bacd1e8a95baf83a388bba6d00fd091de76f8525a","observation_id":"d6418dc0-ac6f-41fe-aee6-a90e65478485","resolution":{"observed_at":"2026-08-11T10:19:29.937840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.220609Z","title":null,"venue":null,"work_id":"fa27586d-bcae-42f1-99ab-75f2c1a728f5","year":2024},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.907248Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:3d5d24ef5f3b1669b9176073f5ad06e5eb6d9df7edb3f8c64bc51af5c5db9919","observation_id":"f11bed25-02f1-42a3-9d29-576d23ff5d8e","resolution":{"observed_at":"2026-08-11T10:19:30.225257Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:19:30.157623Z","title":"eel sushi roll","venue":null,"work_id":"20b0cc01-b57c-4477-bdc0-5df9f25226fd","year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.941556Z"},"links":{"citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:9127433a5b86c6b94f0290b0adb1db79281b3b9e5fec1ce79ef9ecdad2d8c8e9","observation_id":"65fb917c-416b-4800-8645-d7fafb70a69c","resolution":{"observed_at":"2026-08-11T10:19:30.161075Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":33,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2412.16822."}