{"as_of":"2026-08-13T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ade7527f9f9dd42a96c690ba8fe73d6b8c9b75a1d9b3d7b36383bd7d6cdd1b97","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:27.939105Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:59:53.959732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T05:49:08.291505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-08-06T10:59:53.959732Z","title":"Native-resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23268","last_updated":"2025-08-04T02:46:11Z","snapshot_observed_at":"2026-08-13T11:35:09.809757Z","submitted_at":"2025-07-31T06:07:20Z","title":"PixNerd: Pixel Neural Field Diffusion","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:53.959732Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2507.23268"},"observation_digest":"sha256:9035a42ded55c869df8029d64f69291be6fd503f144bfb7e4dd4919a7aa980ba","observation_id":"27e6125d-c332-49bb-83cc-97af61f0e6bc","resolution":{"observed_at":"2026-08-06T10:59:53.959732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-08-05T10:19:54.506238Z","title":"Native-resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-12T13:09:26.368737Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T10:19:54.506238Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2509.04394"},"observation_digest":"sha256:7f24b97025a2b9a7e48e47392eb64b0fc8fe0c73b2868b56c1dd52c1fd5906b5","observation_id":"9359812e-9cde-4758-a93a-988074429599","resolution":{"observed_at":"2026-08-05T10:19:54.506238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2506.03131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native-resolution image synthesis","venue":null,"work_id":"05e39f33-4d2d-4d9e-9904-228f03adc7b2","year":2025},"citing_paper":{"arxiv_id":"2511.19365","last_updated":"2026-04-08T04:08:23Z","snapshot_observed_at":"2026-08-11T04:23:34.279866Z","submitted_at":"2025-11-24T17:59:06Z","title":"DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T05:47:24.669763Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2511.19365"},"observation_digest":"sha256:160edc3aeef4b9c49715156b5c27bd794526081484e52e02ab9c39f49baa47a9","observation_id":"fcc0f4d4-3bec-46a9-afc1-1ea50c3a58ef","resolution":{"observed_at":"2026-05-17T05:49:08.294010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2506.03131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native-resolution image synthesis","venue":null,"work_id":"05e39f33-4d2d-4d9e-9904-228f03adc7b2","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:a6c1d2a0fd2643c2cea72b3095ad232cd2ea3849e859ba894712497901512334","observation_id":"cdf67ea2-5bff-46e8-b1f9-b09fb03a980a","resolution":{"observed_at":"2026-05-11T21:51:11.672181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-08-01T13:38:57.401548Z","title":"Native-resolution image synthesis.arXiv preprint arXiv:2506.03131, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19064","last_updated":"2026-07-22T15:23:32Z","snapshot_observed_at":"2026-08-09T20:16:43.724217Z","submitted_at":"2026-07-21T12:55:34Z","title":"Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:38:57.401548Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2607.19064"},"observation_digest":"sha256:9bc1cf67aef89be6c921b1bc229dabebda31320551440b570e83d634dd2dbc4e","observation_id":"de2cb3be-e99b-4213-9930-2e68296213a9","resolution":{"observed_at":"2026-08-01T13:38:57.401548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03131/citation-record","integrity":"/paper/2506.03131/integrity","json":"/paper/2506.03131/citation-record.json","paper":"/paper/2506.03131"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:15:20.987565Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:20.987565Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8bd6d22a1b6bf240cbaeb30115ba15f1c348f099cfd034005f8365490c092c22","observation_id":"f161e984-723d-47a5-ad79-9f907838ce09","resolution":{"observed_at":"2026-08-07T11:15:20.987565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-07T11:15:21.066092Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions.arXiv preprint arXiv:2303.08797, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.066092Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:85c0fcf27c925ce54126a3528599b4af88f0a81c6bbb718ad649f9b94fb6d0fc","observation_id":"2f3135aa-8ffd-44f2-86a9-b3dc8ff00d74","resolution":{"observed_at":"2026-08-07T11:15:21.066092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15571","last_updated":"2023-03-09T15:18:40Z","snapshot_observed_at":"2026-08-12T12:53:05.797256Z","submitted_at":"2022-09-30T16:30:31Z","title":"Building Normalizing Flows with Stochastic Interpolants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15571","snapshot_observed_at":"2026-08-07T11:15:21.162998Z","title":"Building normalizing flows with stochastic interpolants","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.162998Z"},"links":{"cited_paper":"/paper/2209.15571","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0010d365074cce4b9aa11502634b140f02fbb60f60f8c7b52b4764a9412d1eb3","observation_id":"25b1c9d2-6bca-4aae-99ae-4fea246ec421","resolution":{"observed_at":"2026-08-07T11:15:21.162998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:15:21.344876Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.344876Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8dad0e2b2e7a35eb2d7f9734a80aec925a4309ff7942a68c807c616d9ebbd6f4","observation_id":"0a9ecd36-6c81-4671-bc92-07b176fd83f5","resolution":{"observed_at":"2026-08-07T11:15:21.344876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T11:15:21.483651Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.483651Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:fa2535a272f24f0d5b4e284ef21b3c886551419ece75ae48dd0be9a32da10c85","observation_id":"98f66a24-4a99-4702-b379-d7a5dff555e7","resolution":{"observed_at":"2026-08-07T11:15:21.483651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:21.596345Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.596345Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:98fa2df5d72c4a2482f07c2c43246968c9ca92b88f1734570171d45a66c86fd9","observation_id":"482644b1-f70c-4076-9850-9e8fd82dd5a2","resolution":{"observed_at":"2026-08-07T11:15:21.596345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-13T13:10:50.058243Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T11:15:21.740312Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.740312Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:d729977da5887e0f0b29bfb7ed11f141002b6e7049fd2e4877b24445e487367e","observation_id":"36887104-8b08-42f6-9869-9f24112971e3","resolution":{"observed_at":"2026-08-07T11:15:21.740312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:21.900913Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.900913Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:ff2f84c3368bad6ec0a0a8973119f22a3fbd18deb30a18a578d38b9a4e9a2a70","observation_id":"24041d9d-d77c-4be2-8835-cd52dd56f01a","resolution":{"observed_at":"2026-08-07T11:15:21.900913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16450","last_updated":"2024-03-24T17:14:11Z","snapshot_observed_at":"2026-08-13T05:40:53.599994Z","submitted_at":"2023-10-25T08:13:02Z","title":"CLEX: Continuous Length Extrapolation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16450","snapshot_observed_at":"2026-08-07T11:15:22.062379Z","title":"Clex: Continuous length extrapolation for large language models, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.062379Z"},"links":{"cited_paper":"/paper/2310.16450","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:1093f5ff9f922951905c9602ec5b48a65bb1aae0d85aee62eecb2249a53bb6de","observation_id":"7bd3b75c-c651-403f-9c05-5ed7b935108d","resolution":{"observed_at":"2026-08-07T11:15:22.062379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:22.223665Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.223665Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:f54c2345d6ebbc10e0a4216d39c74b4860a772bab7d3f4079718e9691319a6e3","observation_id":"bf88a2d5-a92a-43bc-b731-4b7e242a8bc7","resolution":{"observed_at":"2026-08-07T11:15:22.223665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T11:15:22.301847Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.301847Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:933df30222f214f49fd80e26835debd0f55859e80915f7cfc05314c5b558aa84","observation_id":"cf4dee61-1d22-41b8-974f-d9699b0d446e","resolution":{"observed_at":"2026-08-07T11:15:22.301847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-12T22:23:31.463156Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-07T11:15:22.346398Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models.arXiv preprint arXiv:2410.10733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.346398Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:93be0a7f59561cc0f5e1591bc4358a5ad631c2282e485ca285275271024660a7","observation_id":"a12c5aa2-2178-4d83-a23b-245e5e273836","resolution":{"observed_at":"2026-08-07T11:15:22.346398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:15:22.444972Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.444972Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e9adbe86a17e0d17ef310c10779e39e212937c329c4b93c940b7bfd8ff4a9143","observation_id":"37a638ae-47dd-4725-b78c-fbb8d9a149ae","resolution":{"observed_at":"2026-08-07T11:15:22.444972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:22.559084Z","title":"Ramadge, and Alexander Rudnicky","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.559084Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0a22f58a0177b8f7d06894cbbeb1adcd7a556130c77006555ff9d941447650b9","observation_id":"30a6ae75-d721-4469-978d-ae9d04b7e3c4","resolution":{"observed_at":"2026-08-07T11:15:22.559084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T11:15:22.663379Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning.arXiv preprint arXiv:2307.08691, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.663379Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:4b9b5834c9daf02906cd922be4bf3ce22ebbd522a6b27f1ec8b55d564c37baa8","observation_id":"4e167c0e-2123-43cc-8301-97552952d1c9","resolution":{"observed_at":"2026-08-07T11:15:22.663379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-08-13T10:57:21.105164Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-08-07T11:15:22.753088Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution.arXiv preprint arXiv:2307.06304, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.753088Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c1df7a6c5f3ed5c06ff4ae5328b75a9e2eca0ea5495bdd97246cba3a27e2ad43","observation_id":"a0eef25d-31f6-4a4f-ac30-1290f02b085f","resolution":{"observed_at":"2026-08-07T11:15:22.753088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:22.857667Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.857667Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:bcdfe2f8ea038cacc5c90d585991fc612c48b56c87003df6ae843f8a966a948b","observation_id":"3d12a58b-b8ce-424e-b677-f71b6e6545a2","resolution":{"observed_at":"2026-08-07T11:15:22.857667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:22.952406Z","title":"Diffusion models beat gans on image synthesis.NeurIPS, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.952406Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5f0f1519a7df51cca621ff4279f6b47db430628e2076cfe9603569285b0c1bfe","observation_id":"075d9e44-70a8-4a9f-8aed-baa97876e823","resolution":{"observed_at":"2026-08-07T11:15:22.952406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:23.035803Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers.Advances in Neural Information Processing Systems, 35:16890–16902, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.035803Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e26cd24e5a3d5e7887b9ab55a40803e80e9f8ce06f6acb341992816669b6a167","observation_id":"21b77b61-a5a6-43a9-aa68-e0b466eb3bfa","resolution":{"observed_at":"2026-08-07T11:15:23.035803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-07T11:15:23.081198Z","title":"Longrope: Extending llm context window beyond 2 million tokens.arXiv preprint arXiv:2402.13753, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.081198Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e0226fc35a8c117d3ebe2a8d20c140a2156ea012191a3db8dd97da44cb5944e2","observation_id":"7f65b2fc-1edc-4fbf-a366-a0a6211fc287","resolution":{"observed_at":"2026-08-07T11:15:23.081198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T11:15:23.137904Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.137904Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:473c3ba8887bde1eccf976a42276caa466d212eeced8eff9915dde76c61b1ce0","observation_id":"b6634200-3a29-45aa-bf3b-019f36625017","resolution":{"observed_at":"2026-08-07T11:15:23.137904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:15:23.254388Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.254388Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:d69306bf91277eb7a99068c8951d376d85179dc79a2475af4f9e5e099caba860","observation_id":"9266811a-34a5-4f0d-a98c-7a7c7ff95be3","resolution":{"observed_at":"2026-08-07T11:15:23.254388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.876622Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"304d087f-43bf-416d-94f2-4f3ec44c9118","year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.341339Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:d095d6435b6d2362ea9c28b27de21336959b84d147feb247dbd549e48ea2234f","observation_id":"a75da351-980a-499c-96e2-3b060461a921","resolution":{"observed_at":"2026-08-07T11:15:28.880751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.863818Z","title":"Make-a-scene: Scene-based text-to-image generation with human priors","venue":null,"work_id":"6c5b68b7-c5d1-4238-a278-edc76412ac17","year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.502549Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:2af63af25b49d28b895574305b54d2fcd0b10f34aa937e7e4eac72e939f73c4b","observation_id":"2735251d-14fc-475c-b0af-faa2d07ed9c6","resolution":{"observed_at":"2026-08-07T11:15:28.868042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14389","last_updated":"2024-02-21T15:45:20Z","snapshot_observed_at":"2026-08-13T12:17:17.748027Z","submitted_at":"2023-03-25T07:47:21Z","title":"MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14389","snapshot_observed_at":"2026-08-07T11:15:23.667405Z","title":"Masked diffusion transformer is a strong image synthesizer.arXiv preprint arXiv:2303.14389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.667405Z"},"links":{"cited_paper":"/paper/2303.14389","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8d1242875bd00438b0dae6488d523ff8eff6cc0f32b28b9962d851320b0a09d7","observation_id":"fca8e983-a16a-4156-8cd2-08fe6dec3114","resolution":{"observed_at":"2026-08-07T11:15:23.667405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:15:23.833220Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.833220Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:96268f72ef120f94598623e53abd8469132e1d65f2f8cb5172e93eeb48459d90","observation_id":"690b89dd-e414-4967-ac73-ece6bb013ac7","resolution":{"observed_at":"2026-08-07T11:15:23.833220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-13T10:24:04.166455Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-07T11:15:23.945547Z","title":"Lm-infinite: Zero-shot extreme length generalization for large language models.arXiv preprint arXiv:2308.16137, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.945547Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:a972184f6632769ee03135e4d4b2e4a62ea06230b05679ed20a8d6ab0adae6bf","observation_id":"59c4f0f8-6bc4-4735-a902-d56b017cf2cc","resolution":{"observed_at":"2026-08-07T11:15:23.945547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.850954Z","title":null,"venue":null,"work_id":"069a56dd-0901-40b8-b889-1e52d2d825c5","year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.972830Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c2384801c8985470b5e01a4cf91dd8de83c0449e68e5d520916d6d551b0ca2ef","observation_id":"97a0a116-776d-47a9-b3eb-f5fb76a55301","resolution":{"observed_at":"2026-08-07T11:15:28.854999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.033223Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.NeurIPS, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.033223Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:1f5f7dbad160d99bc9abdcce09920ec17b83708c687e00c4dba2015958c406d9","observation_id":"8227c911-c8cc-4169-a446-eaf113c41080","resolution":{"observed_at":"2026-08-07T11:15:24.033223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.115501Z","title":"Denoising diffusion probabilistic models.NeurIPS, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.115501Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:fdba358ba05e19180592f85adac470742c602f705a9dee28149bc6946f70697d","observation_id":"9e245ee0-ed18-44f3-80af-a4c50841404c","resolution":{"observed_at":"2026-08-07T11:15:24.115501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.821892Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"dab0ee16-d7b4-4358-98a3-e88b78cec0af","year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.240951Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:26482c386b1bf65dd4988a18797e24839578c835518cd0ac76f1f5d0459a32ff","observation_id":"cd4ca75d-a2af-4e68-a9ec-0461fbeceaa5","resolution":{"observed_at":"2026-08-07T11:15:28.826312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.809053Z","title":"Estimation of non-normalized statistical models by score matching","venue":null,"work_id":"22d1a348-9ba4-444d-9806-c01e34e9fea3","year":2005},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.313090Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:17934836e37049d0ac618d931fa7320368aeaea1297b3575d852f02a758eb7aa","observation_id":"24e79e3f-64d7-4472-a757-c37db8b6d5c8","resolution":{"observed_at":"2026-08-07T11:15:28.813464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.796709Z","title":"Springer Science & Business Media, 2005","venue":null,"work_id":"f7344e51-6a73-4e3e-9d02-b3cb0378b695","year":2005},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.402250Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:224940c654df473fc4773cd9abb0878a36af5a3ce79597da47fb732728559067","observation_id":"d7feca47-4f14-4ee1-8e51-1838f68d4963","resolution":{"observed_at":"2026-08-07T11:15:28.800801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:15:24.469159Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.469159Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c18cfab4f9e1928fafba3fa32d5c8a37800e58236ad11947abd743e2d22be578","observation_id":"f8eb2c10-6433-47ed-9611-8d1e20dcf930","resolution":{"observed_at":"2026-08-07T11:15:24.469159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.783909Z","title":"Elucidating the design space of diffusion-based generative models.NeurIPS, 2022","venue":null,"work_id":"6a5dc1af-5cb0-4097-96a0-c782eb2bed82","year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.558757Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e45fd2f8fca01c0cfe8cfad4254a85a4ed5d2993ae7def715f9d04e4ac4e25e4","observation_id":"e89498af-fbf2-4efd-9657-89d87486a412","resolution":{"observed_at":"2026-08-07T11:15:28.788083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.651388Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.651388Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:dcdbbd901e4a02744186f28e4fc308097d4941b6d538e1666df7dea5e06d6d2f","observation_id":"0cdcc470-883f-4204-a57c-48b908bba491","resolution":{"observed_at":"2026-08-07T11:15:24.651388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.746027Z","title":"The impact of positional encoding on length generalization in transformers.Advances in Neural Information Processing Systems, 36:24892–24928, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.746027Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c313c02291bcb9aaa33ce9132d61f79f0fd37d47d42976dff88c3588128eb368","observation_id":"40cc2cb7-e7c6-486d-a911-b22ce04c4bfc","resolution":{"observed_at":"2026-08-07T11:15:24.746027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.811862Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.811862Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c0d668f6018a7b9b3204d9bc1d2db2af2ed17ae35ce4dc14e9e689f7899c6ebb","observation_id":"3093cf34-c5da-4be4-8bc6-d61fc33f4068","resolution":{"observed_at":"2026-08-07T11:15:24.811862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02027","last_updated":"2022-10-05T20:14:52Z","snapshot_observed_at":"2026-08-13T18:55:15.925966Z","submitted_at":"2021-06-29T04:37:23Z","title":"Efficient Sequence Packing without Cross-contamination: Accelerating Large Language Models without Impacting Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.02027","snapshot_observed_at":"2026-08-07T11:15:24.901809Z","title":"Efficient sequence packing without cross-contamination: Accelerating large language models without impacting performance.arXiv preprint arXiv:2107.02027, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.901809Z"},"links":{"cited_paper":"/paper/2107.02027","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:2122f813c287cb45a0dafd4df3ae9245a44aa50247a3f294cfd18033a899b678","observation_id":"14fe30ba-120e-49c9-858d-5e0e414a31ad","resolution":{"observed_at":"2026-08-07T11:15:24.901809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.748368Z","title":"Kynkäänniemi, T","venue":null,"work_id":"1c0dfadb-7388-47c9-bdf4-27b3793d29f1","year":2019},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.993696Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:f0b72e7190518f01287de526e80b5c556b5da404a877128ec2b6354f9f48477a","observation_id":"59142b54-efb8-48f4-b716-dd3ad09df58a","resolution":{"observed_at":"2026-08-07T11:15:28.752721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:25.083512Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.083512Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:2d3683528706142d1672855bdb7a6e545c43bddbbf9f00dce920563e1722cb44","observation_id":"d0934f07-f05c-41d8-ae65-faedd23d444a","resolution":{"observed_at":"2026-08-07T11:15:25.083512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T11:15:25.150326Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.150326Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:131153548a395c1316b44aa8f12f7355ff96d8db9209bc2fe84fd1dc3ed97d62","observation_id":"56bab1c0-cbb0-42d6-89b9-beea2051c08e","resolution":{"observed_at":"2026-08-07T11:15:25.150326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:15:25.242734Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.242734Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:71b050b1e0dbb128bc8f7d7b6f5fa8f4182bf8eabe6dabb663abc694a6135fc2","observation_id":"7f2c05bc-dbca-441d-ad90-ed26bc2b99c3","resolution":{"observed_at":"2026-08-07T11:15:25.242734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:25.343513Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.343513Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5ba60f7a4c63ca737d8b9fc8a3570205abf46ffbea919b9c972ab68a1a1c64ce","observation_id":"8eb9cfa1-38f8-4c25-92cd-1445e60c001e","resolution":{"observed_at":"2026-08-07T11:15:25.343513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.720728Z","title":"Ntk-aware scaled rope allows llama models to have extended (8k+) context size with- out any fine-tuning and minimal perplexity degradation","venue":null,"work_id":"fb3c1b34-90eb-406f-ae71-d13b04607e87","year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.437263Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:63cf01eea579fe2aa734d76177c0a8ae8f972a3155e633185d5ddb3099be0136","observation_id":"737abe9f-7f54-4bd9-9676-6e4f7176a03c","resolution":{"observed_at":"2026-08-07T11:15:28.724807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.708332Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"0aa2bace-5e1c-481d-ab92-b6bd899f3879","year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.532035Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:dd5dc6e1f29b02aedca877cc2e87acff6d1970f5d53a56ed8107606b6de6c739","observation_id":"1949db0f-b8ea-4485-9e50-8ad4295c7220","resolution":{"observed_at":"2026-08-07T11:15:28.712428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-08-13T04:41:48.311151Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-07T11:15:25.626014Z","title":"Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers.arXiv preprint arXiv:2401.08740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.626014Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6a2dc395baca099381533abddf71a407b859805bd919559c75969f99816b83f7","observation_id":"9c7ee035-06ae-454e-b0ec-dc99ee5045b9","resolution":{"observed_at":"2026-08-07T11:15:25.626014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-13T13:02:41.137021Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-07T11:15:25.685719Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations.arXiv preprint arXiv:2108.01073, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.685719Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0b33cb6eff68561d50fb5a6df609a8a8b79aa25367d7ab98002dd93fe04344bb","observation_id":"7d6d7170-d0b0-4583-97be-6fb4415c56dc","resolution":{"observed_at":"2026-08-07T11:15:25.685719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:25.754276Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation, april 2025, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.754276Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:d1ee9e5cbbb68352d3948385e0a4e511b2b6652154032019f55820ceb3227351","observation_id":"9924311c-de1d-4408-8f2f-f291691e1ec4","resolution":{"observed_at":"2026-08-07T11:15:25.754276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03841","last_updated":"2021-03-05T17:56:03Z","snapshot_observed_at":"2026-08-10T12:14:10.719052Z","submitted_at":"2021-03-05T17:56:03Z","title":"Generating Images with Sparse Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03841","snapshot_observed_at":"2026-08-07T11:15:25.847259Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.847259Z"},"links":{"cited_paper":"/paper/2103.03841","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:9589a5a322fb6e2b022ede1897f011279a8cc88d75afeb58da39417cc48d045c","observation_id":"176abfe9-1a39-4f1a-9b10-41cea373b490","resolution":{"observed_at":"2026-08-07T11:15:25.847259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T11:15:25.908440Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.908440Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:b2f3743e94800e71f921c4ae16b187399c7257a1dfc7543146be9e900293a468","observation_id":"50145533-0526-4762-8c89-8f8e77d0c46b","resolution":{"observed_at":"2026-08-07T11:15:25.908440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:26.003489Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.003489Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:543ca9bc7f99a48911722fb47f4829b9000b91c356fada01689e6937306b3776","observation_id":"1be92052-8696-4bc8-bb13-94b934de05ee","resolution":{"observed_at":"2026-08-07T11:15:26.003489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.680344Z","title":"Pearson Educación, 1997","venue":null,"work_id":"429603d0-49e1-4caa-9e41-ee723aadae91","year":1997},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.101969Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:ca37cc2a65339f3121f39e157f5d99b4e6cf33ec9b4b511e20deca7d8d8c3fe7","observation_id":"ee5d10d4-65d7-47d6-8d57-c7b7d402f663","resolution":{"observed_at":"2026-08-07T11:15:28.684253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T11:15:26.216276Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.216276Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:81d4047a666b49d6ba65ef8cf258d36f49cb610d19fcf907d48a42c89879ed54","observation_id":"dac0b850-91bb-4a63-ae5b-d2a21564678b","resolution":{"observed_at":"2026-08-07T11:15:26.216276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:26.240491Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.240491Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:491656177fb8e3a8c0813ba1cd6f77621bf1b44cff45a26625e9196c37869c84","observation_id":"e035af05-5512-49fd-9f08-8178163eca4f","resolution":{"observed_at":"2026-08-07T11:15:26.240491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-07T11:15:26.393194Z","title":"Yarn: Efficient context window extension of large language models.arXiv preprint arXiv:2309.00071, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.393194Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:26056819353d03579c7e8f0b58c410ec2c44d535cf06090be0200f5e056a925b","observation_id":"c6229fcc-5086-40ef-b099-856cb9f7ca87","resolution":{"observed_at":"2026-08-07T11:15:26.393194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T11:15:26.611490Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.611490Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:ea42dc20fc4b6e5d2867a0eb1041ddc07dbea2a643f6b9e07cc2565bcd5ba11c","observation_id":"316110c1-aa34-4e6a-be20-971ffabbd9d2","resolution":{"observed_at":"2026-08-07T11:15:26.611490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.659928Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":"c859df9e-1a91-4a60-b68c-623eaadf72bd","year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.733572Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:d2986b597674d9fb09c4c6de611b962fc67c50dc40af8429a46f1ea938c0b7e9","observation_id":"5eb6cec8-4910-4f10-9042-b9a2d792f6e9","resolution":{"observed_at":"2026-08-07T11:15:28.664013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T11:15:26.885811Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.885811Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:b76c217fef28ceb5bd2674075b2754b2ed08dad258e7980b5ccd77631ac026b3","observation_id":"5a6bdc94-a183-4f9d-bf8a-d1d796de94ed","resolution":{"observed_at":"2026-08-07T11:15:26.885811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.647414Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"c6d61db9-de3a-4268-a745-574f74dc1908","year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.054517Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:ef27ec378aa9d9f7b1cca2f33f629b22f81a4f36ef8fd588569c874a8b217439","observation_id":"8ffbd902-cd6a-4e03-a83b-f6f1c0ac3e0c","resolution":{"observed_at":"2026-08-07T11:15:28.651576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.070558Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.070558Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0f1f0f5c3dcde417ab4d02d20b5b4886611bb4e3a1d30e3fe3629706f6ec7ce4","observation_id":"0bd08008-c6e1-48c2-b0be-83378756de88","resolution":{"observed_at":"2026-08-07T11:15:27.070558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.627842Z","title":"Salimans, I","venue":null,"work_id":"d0eab0e6-d5ac-4338-ae1e-3523837845fe","year":2016},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.151937Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:83d12170371a29056c0b55bb32ff36498c74a7d82d2d63aa6f31da1b0b664683","observation_id":"c56deb2a-9f32-42ed-9608-37e81cf4df64","resolution":{"observed_at":"2026-08-07T11:15:28.631694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.248286Z","title":"Adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.248286Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0ad623afa9cf3d47e35ef4d22ac68027207afc193e39bf05957290a49ec60e46","observation_id":"44ae72e7-1e62-4d6c-aeed-948c21a8ffa2","resolution":{"observed_at":"2026-08-07T11:15:27.248286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.252346Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.252346Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:d9a20db259774ac3c1af394e6dee921e0a448392178876528220708845091237","observation_id":"2578c484-905e-4f72-8bfa-528f3bc0bc88","resolution":{"observed_at":"2026-08-07T11:15:27.252346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.280745Z","title":"Improved techniques for training score-based generative models.NeurIPS, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.280745Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:20dd760bc618a367bcf958289a22b72994be7447dbdb52395a6e4000b053c24e","observation_id":"0f6a762a-4f27-4862-8e9c-0f80710cc57a","resolution":{"observed_at":"2026-08-07T11:15:27.280745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T11:15:27.370087Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.370087Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8b2d639e742ef30f9a4c35dc605b706fd6ea929c99a305b887c64d2ef00d0452","observation_id":"9fc7b962-7f85-4147-aac0-8b289c67f08d","resolution":{"observed_at":"2026-08-07T11:15:27.370087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.590761Z","title":"Springer, 2013","venue":null,"work_id":"85f79e57-d9aa-4948-bc1c-d18e4907f2c1","year":2013},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.447708Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:771611a4d11be028ce2cd7e0bd74772ea10d4dcc3eecc5767e48b0be4df06f5e","observation_id":"a50211fc-31df-4d42-880a-43456de3815d","resolution":{"observed_at":"2026-08-07T11:15:28.594798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.526473Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.526473Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5218886c2147592dcf50274a4ea7435b93d754f8eb9e5bb993411d91d26fffd0","observation_id":"89af2ae6-5db2-4524-b0e6-10fc1ffcdc73","resolution":{"observed_at":"2026-08-07T11:15:27.526473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-12T17:57:54.262483Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T11:15:27.613456Z","title":"Autore- gressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.613456Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:158da41b7ecfd3816b79cea139f5bd580c5f93f9433e5e1ac56f97544027cd85","observation_id":"8a5d7fff-8a42-40cb-957c-aa7367634621","resolution":{"observed_at":"2026-08-07T11:15:27.613456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T11:15:27.691230Z","title":"Seed1.5-vl technical report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.691230Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6eb4285b66153d85e642cf888dd2e92ddbc0cc85efd40b61e8f0eb9b89d42e2f","observation_id":"b8dae6e2-b953-4ce0-8233-84253194770e","resolution":{"observed_at":"2026-08-07T11:15:27.691230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:15:27.762445Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.762445Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:929b7fa04f186d0deacbe63527db32ea0e6c22622798bc34ca9e2d43d3c512de","observation_id":"4f4b7648-4cc5-42d5-9820-a4a588dfc9c6","resolution":{"observed_at":"2026-08-07T11:15:27.762445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T11:15:27.846475Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.846475Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:9368296ca74e55f5834155f2f69edafd13170e5ef0b0539b51ed87db3f32b832","observation_id":"983512aa-42be-4090-a934-f5d5f5aa5f3f","resolution":{"observed_at":"2026-08-07T11:15:27.846475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T11:15:27.879113Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.879113Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e9db14e3aeac6a616d7b67cd070008219e4d690c6f78dc8ce827ae40c6b8ef6e","observation_id":"c2b9a487-b8ab-48e9-9476-b94bf5e51ded","resolution":{"observed_at":"2026-08-07T11:15:27.879113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:15:27.883333Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.883333Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:b290e70b145b9351ab9f901d422019bcf453da999872b2c1d42b3520c761436d","observation_id":"ca6ce34a-977b-44cb-b5e1-2db8299ff808","resolution":{"observed_at":"2026-08-07T11:15:27.883333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T11:15:27.894108Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.894108Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:da1dd18309d1213cbb2b0edaa8051c0a023780a9fc4fa37e4e7a81adcdf78720","observation_id":"ddef2aa0-1b0b-4acd-b6ca-d818d7237e27","resolution":{"observed_at":"2026-08-07T11:15:27.894108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.897881Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.897881Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:9ef9d68165b9707c1f9c7386a1a7dfaf042d88cab6394b8cbb146cbbd9d0980b","observation_id":"bf6fd23a-01d3-413b-a43b-f0cfa40d0d82","resolution":{"observed_at":"2026-08-07T11:15:27.897881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:15:27.901577Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.901577Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:ae41c3512d9124204bcdaa9c9850838250d1a2fe66842ff03b3a0de702875c5e","observation_id":"2717444f-37c8-4a18-b2ae-3112867016f3","resolution":{"observed_at":"2026-08-07T11:15:27.901577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:15:27.905511Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.905511Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e1cc9cea14085a7b6f13def918035e8750916cf24bd4596c300f706909bbc32f","observation_id":"8d8f8cfe-f9e0-4bdd-8cae-ecbeeee76172","resolution":{"observed_at":"2026-08-07T11:15:27.905511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22655","last_updated":"2024-10-30T02:48:50Z","snapshot_observed_at":"2026-08-12T22:12:14.226262Z","submitted_at":"2024-10-30T02:48:50Z","title":"FlowDCN: Exploring DCN-like Architectures for Fast Image Generation with Arbitrary Resolution","version":1},"cited_work":{"arxiv_id":"2410.22655","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22655","snapshot_observed_at":"2026-08-07T11:15:28.069883Z","title":"FlowDCN: Exploring DCN-like Architectures for Fast Image Generation with Arbitrary Resolution","venue":"cs.CV","work_id":"4f50d9f9-9d16-43ca-a374-f7f1c2cb691d","year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.909683Z"},"links":{"cited_paper":"/paper/2410.22655","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5d56e338920b3e1fbde8a88aacc40db3cd17d2ebd8c2aa43f340c5616ffea09a","observation_id":"bf02c922-3487-4c70-8f08-d8fbfc4217d2","resolution":{"observed_at":"2026-08-07T11:15:28.075956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13925","last_updated":"2024-10-17T15:51:49Z","snapshot_observed_at":"2026-08-12T22:20:49.210485Z","submitted_at":"2024-10-17T15:51:49Z","title":"FiTv2: Scalable and Improved Flexible Vision Transformer for Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13925","snapshot_observed_at":"2026-08-07T11:15:27.913353Z","title":"Fitv2: Scalable and improved flexible vision transformer for diffusion model.arXiv preprint arXiv:2410.13925, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.913353Z"},"links":{"cited_paper":"/paper/2410.13925","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:67d6b2c522797c69864048cdb656d44b122b87aaf266e17c7b762996eefd9294","observation_id":"835a150f-1d8a-44a9-8172-b9ec0f5a1bc0","resolution":{"observed_at":"2026-08-07T11:15:27.913353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T11:15:27.917023Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.917023Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:038c221e98123f065d703b62464ee89a3084a60bd0718626a5f1202020558402","observation_id":"b84bce03-8b41-4f15-861f-92659f6b1a16","resolution":{"observed_at":"2026-08-07T11:15:27.917023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:15:27.920953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.920953Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:216bea423c9fb218e059aafe3f09809ee580519b5e23fd93c1d91c9a81f5281c","observation_id":"9d157082-e74f-4f26-9d4f-e2affd1a205a","resolution":{"observed_at":"2026-08-07T11:15:27.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T11:15:27.924274Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.924274Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:7407c40f5787a083bbcf4b33c80dc8cb5167b1b65510a226adf44100ddb175ca","observation_id":"d4e4bee8-5a77-40fe-8ac7-355eaf138879","resolution":{"observed_at":"2026-08-07T11:15:27.924274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T11:15:27.927710Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.927710Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:99243d387d1d2230edc7ba1fd23dbf65b21606b0a5d35cb7a15f68ff461adcf5","observation_id":"0947f8ca-f047-4568-9340-f074930b1d8f","resolution":{"observed_at":"2026-08-07T11:15:27.927710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-13T13:45:12.888881Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T11:15:27.931555Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.931555Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:9c4a0870ba4219a2ccbd8bf5443f41c4513be7536ffb73710729998d9cc1200c","observation_id":"aa682b6b-9d61-4183-9d58-2f8001db09e3","resolution":{"observed_at":"2026-08-07T11:15:27.931555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-07T11:15:27.935094Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.935094Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8bce3b8cce19f8d280ba93e9266535b8f07864f8965a664c3b10a2a0100cdc1e","observation_id":"96980f9b-1acf-47de-821d-41f3b86bbe48","resolution":{"observed_at":"2026-08-07T11:15:27.935094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10400","last_updated":"2024-02-21T13:37:07Z","snapshot_observed_at":"2026-08-13T10:10:13.414766Z","submitted_at":"2023-09-19T08:03:38Z","title":"PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10400","snapshot_observed_at":"2026-08-07T11:15:27.939105Z","title":"Pose: Efficient context window extension of llms via positional skip-wise training.arXiv preprint arXiv:2309.10400, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.939105Z"},"links":{"cited_paper":"/paper/2309.10400","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:89fe2567463a8f59f9eeffddffeb920f12c9ef80cd54c1c9835ea46b888ec343","observation_id":"cb2c27da-bdac-40a4-9dc7-a7ede0d331e0","resolution":{"observed_at":"2026-08-07T11:15:27.939105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":72,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 5 inbound Pith citation observations for arXiv:2506.03131."}