{"as_of":"2026-08-09T22:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8b70cdb4b04030676f9231e708a65874e50d67ac9d636ca16982673ef81c36b","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:50:00.171859Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:30:23.485228Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:08:50.357414Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"cited_work":{"arxiv_id":"2506.06962","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06962","snapshot_observed_at":"2026-07-03T19:08:50.357414Z","title":null,"venue":null,"work_id":"1a276b07-4baf-4b72-8e0b-42a0537a37ae","year":2025},"citing_paper":{"arxiv_id":"2606.17619","last_updated":"2026-06-16T07:25:08Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:25:08Z","title":"RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T02:02:32.008630Z"},"links":{"cited_paper":"/paper/2506.06962","citing_paper":"/paper/2606.17619"},"observation_digest":"sha256:e0f4edd39ea3054b491b8c3b7c1d8deb96c60e21b26c947c247ad36b757d15d5","observation_id":"35aaae44-7d4c-4e64-9b36-1725aad98f1b","resolution":{"observed_at":"2026-07-03T19:08:50.358851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06962","snapshot_observed_at":"2026-07-14T15:30:23.485228Z","title":"arXiv , author =:2506.06962v3 , primaryclass =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09803","last_updated":"2026-07-09T17:52:16Z","snapshot_observed_at":"2026-08-06T03:03:16.058770Z","submitted_at":"2026-07-09T17:52:16Z","title":"Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T15:30:23.485228Z"},"links":{"cited_paper":"/paper/2506.06962","citing_paper":"/paper/2607.09803"},"observation_digest":"sha256:0ea02528196c209ef9b2d24253238a6e3f24bd368ebe537e6691d8e9898f9326","observation_id":"2571aa8b-e431-40b6-a160-2ce29f98cc57","resolution":{"observed_at":"2026-07-14T15:30:23.485228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06962/citation-record","integrity":"/paper/2506.06962/integrity","json":"/paper/2506.06962/citation-record.json","paper":"/paper/2506.06962"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.625025Z","title":"Towards effective long conversation generation with dynamic topic tracking and recommendation","venue":null,"work_id":"41de8707-fd71-46bb-b9b0-9c4f34126165","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.961345Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:ce3eed928469f2e90aae99928ea49a57311b5e05cb2f4e0e55e171db7e99757a","observation_id":"307a66ff-295c-46cb-bb6f-ec99d41db689","resolution":{"observed_at":"2026-08-07T05:50:00.628400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T05:49:59.965544Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.965544Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:89328dbe3ef328bb3f67c8d859c3b556145ed9b22e92236a87c4ffc68c647dd8","observation_id":"64d2be91-7b55-4ca0-9f5e-a21372a01e21","resolution":{"observed_at":"2026-08-07T05:49:59.965544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.615368Z","title":"Semi- parametric neural image synthesis","venue":null,"work_id":"d0e85105-2871-4dca-88ca-2c52156255d9","year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.969799Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:7d6894dbb0a8302705819ed716da56c164a887a401c9808168487fe413ab17c6","observation_id":"b7133e25-9690-4eb0-9f8f-b9fed9bc8a5a","resolution":{"observed_at":"2026-08-07T05:50:00.618793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.605982Z","title":"Improving language models by retrieving from trillions of tokens","venue":null,"work_id":"724c4d1e-b9a6-4464-819e-0b3851d7f16a","year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.973438Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:fc8baab85e75b2127343312ac5ea9535dbbb130753c7a8ef267337df9750d011","observation_id":"853e6cb8-e911-4077-bd24-f8122edc0d23","resolution":{"observed_at":"2026-08-07T05:50:00.609366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08981","last_updated":"2021-03-30T08:20:34Z","snapshot_observed_at":"2026-08-09T09:33:13.219731Z","submitted_at":"2021-02-17T19:15:53Z","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08981","snapshot_observed_at":"2026-08-07T05:49:59.977186Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts.CoRR, abs/2102.08981, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.977186Z"},"links":{"cited_paper":"/paper/2102.08981","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:96655076e426b1c2fffe817a4d731ce83f4f6a0d8ca32765dbbaba1a5a27113f","observation_id":"8dc5c7c3-b4f4-4086-9b32-c5b43d10ab15","resolution":{"observed_at":"2026-08-07T05:49:59.977186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.596596Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset, 2025","venue":null,"work_id":"e9314f32-1a88-4472-8db1-f2e0a81fa995","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.981218Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:c3b461b0ac22abd85619840de886371ba363fc6f1d729f86388213b7da9d59f4","observation_id":"6fbb9673-30f8-4505-bdf4-16b290fd4bd1","resolution":{"observed_at":"2026-08-07T05:50:00.600119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T05:49:59.985139Z","title":"Kwok, Ping Luo, Huchuan Lu, and Zhenguo Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.985139Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:e2521344eaad27a564f929cb21cb091069d28373f9e73b4a557f17dac9bad7d5","observation_id":"edc6de30-0e8c-4e32-9f24-4fc7fecabb7f","resolution":{"observed_at":"2026-08-07T05:49:59.985139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.587290Z","title":null,"venue":null,"work_id":"95fef598-e837-4467-87a7-19be9f7769d4","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.988929Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:dcdc5cc00bc8cc3bd511ad1ddbddefd71f464fc95b0bcafd5c08f7e0cfe16695","observation_id":"61b5f847-b241-42e2-95f0-87370469fcc7","resolution":{"observed_at":"2026-08-07T05:50:00.590447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T05:49:59.992508Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.992508Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:24ecda53b41a5f188585a11f117c6ab4042997880e3795056c6061ca34ccb979","observation_id":"bc8cf03a-588d-4227-b39a-0cc1377e3a2b","resolution":{"observed_at":"2026-08-07T05:49:59.992508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:59.996279Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.996279Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:94dd5e973bf6647f05404429fc5b8cf0757fc64fdb5e901ca4a8d162cda9af51","observation_id":"9fd6a6ae-f5f2-4cec-b0ff-ef2f1e7a0748","resolution":{"observed_at":"2026-08-07T05:49:59.996279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.13753","last_updated":"2022-12-01T06:29:07Z","snapshot_observed_at":"2026-07-06T13:46:33.740204Z","submitted_at":"2022-08-29T17:37:29Z","title":"Frido: Feature Pyramid Diffusion for Complex Scene Image Synthesis","version":2},"cited_work":{"arxiv_id":"2208.13753","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.13753","snapshot_observed_at":"2026-08-07T05:50:00.333041Z","title":"Frido: Feature Pyramid Diffusion for Complex Scene Image Synthesis","venue":"cs.CV","work_id":"734b6ad3-ce16-48a1-a942-fed3436050ee","year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.999949Z"},"links":{"cited_paper":"/paper/2208.13753","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:ab0face21e49b4ce1496eac7b994e779f3b5babbe33292e8cb2aec0a3d4c748c","observation_id":"712fa45b-7698-41e3-9489-b55fb1d5ff61","resolution":{"observed_at":"2026-08-07T05:50:00.336946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.571354Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"0ef44724-9b5a-4807-8c16-1bf56a4ec663","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.005484Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:1713ff19ca025e89f9ab344a992a282b87b42be49d6ab879f219f4fa1428bbc7","observation_id":"9bfc47b3-12fd-4b45-8bf0-6cf8b4d85b49","resolution":{"observed_at":"2026-08-07T05:50:00.575249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T05:50:00.010895Z","title":"Retrieval-augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.010895Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:625d03cbabd43981959e8c41306044225bfed96623fad37c829461c682154d25","observation_id":"a5881580-67cb-47b6-b134-e35e02448a99","resolution":{"observed_at":"2026-08-07T05:50:00.010895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-08-09T10:38:02.941912Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-07T05:50:00.027350Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.027350Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:ef5467c4852b294681d973d975948be3fd27f077df2b69d31031da52bcd79867","observation_id":"91435f76-e0a6-45e5-9e40-fbd69a2b279f","resolution":{"observed_at":"2026-08-07T05:50:00.027350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-07T05:50:00.032601Z","title":"Kat: A knowledge augmented transformer for vision-and-language","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.032601Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:82fa25394fc83bff364ea34cff791ec4c3cd4e0f2e2b76c3f2cb1e954276dc05","observation_id":"976b4ea1-7398-408c-a3d0-a5c54e7311f6","resolution":{"observed_at":"2026-08-07T05:50:00.032601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.561310Z","title":"Retrieval augmented language model pre-training","venue":null,"work_id":"efaba877-1636-429e-b235-644321104433","year":2020},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.037991Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:f20e38d95cbe12c6f730b035ea916b5f905e4a6c43cf57d90a50f33a767e0998","observation_id":"438992b0-6d5d-445b-a6ca-e037a5afacd0","resolution":{"observed_at":"2026-08-07T05:50:00.564800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.551397Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"05db4842-6a06-4cdc-afd4-84b601c513ce","year":2017},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.043443Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:dc28c1e2ec89008117c7b9b8246c4e0552590a9fa6a6b5cb31922ac1d27c6fc8","observation_id":"a2241fd9-aea4-4d72-ae9f-64a2c82d567c","resolution":{"observed_at":"2026-08-07T05:50:00.555078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.050319Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.050319Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:39494cc1cfb63dea487328f70e294d4eb342a1a8f09624815c42f6d6bcfdf614","observation_id":"07593543-70da-4052-a4e0-17c4bf3870a1","resolution":{"observed_at":"2026-08-07T05:50:00.050319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.536277Z","title":"Leveraging passage retrieval with generative models for open domain question answering","venue":null,"work_id":"9323923d-0b15-49f7-8503-0c20babc6554","year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.056179Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:e20c178aea30f26d20b71b84fdccb6e9ab668858f76751b996f43308a3d279cb","observation_id":"4511be7b-e668-486c-88e3-0cf1da95883e","resolution":{"observed_at":"2026-08-07T05:50:00.539575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.526949Z","title":"Rethinking fid: Towards a better evaluation metric for image generation","venue":null,"work_id":"aec73b88-ff39-46ea-b12e-b0daebd77631","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.061164Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:aa6c3fb1010e3eee31ca3861266d0aeeed28c536a357e74d1c0da382cac412d6","observation_id":"35a7268c-9765-4e22-a072-b5984384abc1","resolution":{"observed_at":"2026-08-07T05:50:00.530349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.065535Z","title":"Billion-scale similarity search with GPUs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.065535Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:063c494e8cfeae52c8f1f8c6f31cce5617501b46af76ebc45bdb8dcbd654c38e","observation_id":"613a8570-b4cd-44e3-bb7e-2010c1fb22d9","resolution":{"observed_at":"2026-08-07T05:50:00.065535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04269","last_updated":"2023-04-09T16:21:43Z","snapshot_observed_at":"2026-07-31T00:56:36.756307Z","submitted_at":"2023-04-09T16:21:43Z","title":"HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image Generation","version":1},"cited_work":{"arxiv_id":"2304.04269","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.04269","snapshot_observed_at":"2026-08-07T05:50:00.293306Z","title":"HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image Generation","venue":"cs.CV","work_id":"7d7649ce-d118-4fb2-adb8-926092dbc274","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.069883Z"},"links":{"cited_paper":"/paper/2304.04269","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:c1b8db7f62398de4739a25e06c04963b524bcbd98fbf687ace46e0b6b3ad12e6","observation_id":"105f5d2e-a632-486f-802d-554abaf6fd0a","resolution":{"observed_at":"2026-08-07T05:50:00.298942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.512220Z","title":null,"venue":null,"work_id":"1f3f3879-6e14-4b97-82d7-645f16116805","year":2020},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.074692Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:d54867e9b0dee3d20d309c6631e04d6f4f9cf1f63349f8f5df04cf5d67cf20a1","observation_id":"7b799476-c683-4fc6-9162-6f9411fa5bb3","resolution":{"observed_at":"2026-08-07T05:50:00.515449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.502547Z","title":"Fine-grained late- interaction multi-modal retrieval for retrieval augmented visual question answering","venue":null,"work_id":"4ae42e34-8601-445a-b0bd-b1a5f6f8ffcf","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.078718Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:cc75ba153da4788b85e45c62eb94594a427a26cb8f2828941d724db431d29743","observation_id":"796e6423-b89f-45dc-b61b-3d7d88a0203b","resolution":{"observed_at":"2026-08-07T05:50:00.506190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08327","last_updated":"2024-06-05T11:46:23Z","snapshot_observed_at":"2026-08-01T04:05:40.608560Z","submitted_at":"2024-02-13T09:47:07Z","title":"PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08327","snapshot_observed_at":"2026-08-07T05:50:00.082375Z","title":"Preflmr: Scaling up fine-grained late-interaction multi-modal retrievers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.082375Z"},"links":{"cited_paper":"/paper/2402.08327","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:8f108c9454b5fa34af11953e6f98970829413dfacafc95925d682b91e174784e","observation_id":"c464a96e-1961-4421-b45a-f4968b352ff9","resolution":{"observed_at":"2026-08-07T05:50:00.082375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.493598Z","title":"Handrefiner: Refining malformed hands in generated images by diffusion-based conditional inpainting","venue":null,"work_id":"0f271709-133a-49e2-9e80-b08553c1d9ee","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.088312Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:15a9bbd5a43d0b1752cdf71ad805f1e2748e88d2dbe4e61ea5bf7ece6c52d156","observation_id":"c548ac04-56a0-4d0a-9609-c43cfc848c4c","resolution":{"observed_at":"2026-08-07T05:50:00.497001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-07T05:50:00.091963Z","title":"Transfer between modalities with metaqueries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.091963Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:ba34e1936b614885c731390717dd855288221cbceb451c3a96869fd221d536b4","observation_id":"f599aad6-3a1c-4ec6-9208-6ab1ee0e5be6","resolution":{"observed_at":"2026-08-07T05:50:00.091963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.484380Z","title":"SDXL: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"95cabd3a-49cc-4112-9a35-a2c7f79ca2e6","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.095712Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:f671ad2a3cc4ba88b93a09c420ad74f19500527249611c6cb34cbbb7ec878f54","observation_id":"1d275fd9-84df-49a8-b25c-931f1e9e1cef","resolution":{"observed_at":"2026-08-07T05:50:00.487925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.099287Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.099287Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:b4736436df12f3d8863c57d6993b6d7b5ec51ad874ced3dab1f667ef69dc7d50","observation_id":"bde39ec9-4a4e-4c71-b61c-8e7345a212d5","resolution":{"observed_at":"2026-08-07T05:50:00.099287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T05:50:00.102884Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.102884Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:ca7c0f76912a2364808e3d5c4a4eb05a1630a24749c6a922a6b498cee3e41b37","observation_id":"21854800-ab86-42d8-9e42-5c217ec6d5c3","resolution":{"observed_at":"2026-08-07T05:50:00.102884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-07T05:50:00.106158Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.106158Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:9875b9cb96b897df5bfc25eb1ee180106216de236f8d7d042da053dc18f20750","observation_id":"54aaef81-83e8-417f-ab70-8dcdbe9c0d2e","resolution":{"observed_at":"2026-08-07T05:50:00.106158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.110226Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.110226Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:e274de788a9ba86f18669ab7fce5de000d0e9fc737f4edccbf842a634adef43a","observation_id":"2cb12436-21e9-4b54-9e7f-b9a803d5fc5b","resolution":{"observed_at":"2026-08-07T05:50:00.110226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.463868Z","title":"Bermano, and Ohad Fried","venue":null,"work_id":"f6dbe33e-3801-4d0e-b71e-25200e936109","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.113894Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:30166605ea3d119fe02c43a0bfd04f04b720574802f5833b0bc9120c19dda073","observation_id":"fce48b6d-dc98-4f77-ad0b-53a0d0366910","resolution":{"observed_at":"2026-08-07T05:50:00.467251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.454599Z","title":"kNN-diffusion: Image generation via large-scale retrieval","venue":null,"work_id":"e57771c4-c208-46ff-9bcf-38e63fd0cc5d","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.117309Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:e24cb7ee60b6a98eeed37c6e58f67725f7c05ed3c75a7f9b70d35aaa946f44bd","observation_id":"40c4ba51-a8a1-4628-98bf-eb50ed8c167c","resolution":{"observed_at":"2026-08-07T05:50:00.458012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.444688Z","title":"Retrieval aug- mentation reduces hallucination in conversation","venue":null,"work_id":"7e1473a2-3bbd-4b6b-be47-4918cc350b7c","year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.121229Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:106ab82e6958729f2979a28ebb9c86fb90f5f5a718b8aebb8c30cc84f1e00750","observation_id":"fba33c5d-0c58-4b5d-88bc-dbc4ec0af2a1","resolution":{"observed_at":"2026-08-07T05:50:00.448267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.128960Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.128960Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:8c62016ada12e6d8a0e4033fc829e92a539154664547e7ac4e52d11197e51832","observation_id":"6d144aad-f07e-4b3d-b96d-a83eb90bc233","resolution":{"observed_at":"2026-08-07T05:50:00.128960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T05:50:00.132362Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.132362Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:5b843cd5a80b033a204593e3cd9eb9290a67caccdd331bd5cd18c14f11b688e9","observation_id":"356e327c-0f9e-4360-9050-d4672b653c1c","resolution":{"observed_at":"2026-08-07T05:50:00.132362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.423835Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"821c868d-6b91-4e59-a180-ddd1faa3f9f6","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.135645Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:21164d3db6bdd56ad52a1bcd5334cd7759389e5fcbd119ca7324197288a8f3be","observation_id":"22f32b96-6336-40f9-b306-adbf8f046317","resolution":{"observed_at":"2026-08-07T05:50:00.427595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.413829Z","title":"Fréchet wavelet distance: A domain-agnostic metric for image generation","venue":null,"work_id":"6b3ae466-43f1-4d0f-a084-2bb80c9dbce9","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.138862Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:2a925cd638f0ec83c1ab155669aff5bda937a90db43357a175f669708d49f641","observation_id":"2e993fd4-2f90-4c5b-bafb-d649bd3d1a3b","resolution":{"observed_at":"2026-08-07T05:50:00.417416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.404726Z","title":"Midjourney prompts dataset","venue":null,"work_id":"cf7c5149-838e-4c40-9f9a-499944695f6a","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.141871Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:f011dd8dd1123e02a24fc9cfcadd1d98ba0c526bfa832ce1e141f0af27aee2ab","observation_id":"698dfdd7-8bd2-49a2-b9cd-17664632897f","resolution":{"observed_at":"2026-08-07T05:50:00.407893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T05:50:00.145033Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.145033Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:5b40eeecef8d89c3ac20e4f3eaaebe16dfa1822d98d90629ed5e11783f7b0a38","observation_id":"2c17aadf-bb35-4f89-ad79-acc49bda02c2","resolution":{"observed_at":"2026-08-07T05:50:00.145033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-07T05:50:00.148561Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.148561Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:4e9319b684130015f5927ceeeeb64ef0bb043fa3a351e397dbf7033e3a31b043","observation_id":"7eab1213-4d83-4397-8543-039fc4d01fd5","resolution":{"observed_at":"2026-08-07T05:50:00.148561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T05:50:00.151862Z","title":"SANA: efficient high-resolution image synthesis with linear diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.151862Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:e28d60b3f18e133ae349b2d1f46748c4f1a33c35a4d82b0115204f39f7b5487a","observation_id":"e4ed34e5-436b-4779-ac92-5997192ed361","resolution":{"observed_at":"2026-08-07T05:50:00.151862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T05:50:00.155401Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.155401Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:87987af0f4d0c13502ab9af84a1f81484635bfa8b8e969ce196fa2df24d9187b","observation_id":"390cbf13-88a6-4503-b756-56a11954b064","resolution":{"observed_at":"2026-08-07T05:50:00.155401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.395370Z","title":"Modality-specialized synergizers for interleaved vision-language generalists","venue":null,"work_id":"8d0eb7f2-be9e-44e1-84d2-e5a07727db5e","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.158685Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:c7ef4821a5b16e66210f0257932b78cd8f7ea6ffc0885cc1affa061a334c35f5","observation_id":"8d701f30-1c00-4b86-97b9-2ded6edda6db","resolution":{"observed_at":"2026-08-07T05:50:00.398761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.385390Z","title":"Retrieval-augmented multimodal language modeling","venue":null,"work_id":"406429a1-17fd-47ff-8bc8-daa8419d791e","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.161798Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:7d0f2b328d069d3d8bef878a914a2a1ba10c14353495e3998332779d900eba65","observation_id":"f070860d-feba-4a60-8bd1-a631a2b63525","resolution":{"observed_at":"2026-08-07T05:50:00.388852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01558","last_updated":"2024-05-05T15:58:24Z","snapshot_observed_at":"2026-08-04T12:45:28.903998Z","submitted_at":"2023-10-02T18:52:35Z","title":"Making Retrieval-Augmented Language Models Robust to Irrelevant Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01558","snapshot_observed_at":"2026-08-07T05:50:00.164958Z","title":"Making retrieval-augmented language models robust to irrelevant context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.164958Z"},"links":{"cited_paper":"/paper/2310.01558","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:fce6de4317ce6fd0c620587fee710356e654ff8b760a8848baecafa529428d4f","observation_id":"df11e4ee-8b63-40a0-88eb-f62b69f90fbb","resolution":{"observed_at":"2026-08-07T05:50:00.164958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T05:50:00.168507Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.168507Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:0653ea598d8049a50e01a2126ba776e10d2d94ad7aba002dd15b2474448405ee","observation_id":"0349970a-a02d-4bfb-b826-ce4611bc89f9","resolution":{"observed_at":"2026-08-07T05:50:00.168507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.375644Z","title":"FineRAG: Fine-grained retrieval-augmented text-to-image generation","venue":null,"work_id":"c9d90979-72c8-4d66-aefd-ad709dc6a2a2","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.171859Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:2d8ee3d9e33376167ad9063478d907fc179faeda3c4d2d2af872502a2b2c5d8b","observation_id":"5b92c257-4a93-4205-bb4d-3f3c6961c622","resolution":{"observed_at":"2026-08-07T05:50:00.379520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.125527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.125527Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:9e32f78d6b62fc2292206f8b8644cb6e8ee33fea9fdcb9e00d56d9021719a051","observation_id":"bc811eb1-6b8e-42cd-966a-c3b113381080","resolution":{"observed_at":"2026-08-07T05:50:00.125527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T10:38:27.700307Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 2 inbound Pith citation observations for arXiv:2506.06962."}