{"as_of":"2026-08-09T10:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:728901e9882e090fdca3056db1255e32d43513ecabb734b86f0e1c7046650d52","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:51:13.254591Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":27,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":214,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:57a7d44f71443169ae6dac90799cb835e825a1240f13dd8171cac13243dbde4a","observation_id":"739d5dad-b6b6-47d5-99ac-9a6729b8ee4d","resolution":{"observed_at":"2026-05-13T20:06:44.615691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:fcf1be6c048b477230e2327e4d0d9dd51216f85c17bd9e416cb00c3f4a3fdd72","observation_id":"2e63b695-acb3-402b-8270-6b1634298980","resolution":{"observed_at":"2026-05-15T22:48:36.344214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T10:03:27.919346Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2405.09818"},"observation_digest":"sha256:7b4c2698b89212fe67ea4f9d5112ed5da12909e0ebd8c7778ac362a98d8a0eb1","observation_id":"a157ff30-ed01-4622-8d76-af1ffb73c384","resolution":{"observed_at":"2026-05-11T10:03:28.152026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:c45625ae2c23dbdb5ebb2ed899b71388c305d6cd356e3a47a10adc391b8d2f75","observation_id":"d85a6cb4-c31f-454c-a2d5-09905940a6cd","resolution":{"observed_at":"2026-05-11T13:10:20.609481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:26.887069Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2408.11039"},"observation_digest":"sha256:e0505d3c790a4fbe8b09d4e655267bf1dd03600302eec1a4e89ae9a028839926","observation_id":"3cdb2fec-7473-4b18-a944-37d7bf23c709","resolution":{"observed_at":"2026-05-13T05:57:26.997276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T00:26:21.313005Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2409.04429"},"observation_digest":"sha256:f2ef6d9190f21dc275a704675dfc15c4b109b9de8b2602f88ad1640677528278","observation_id":"50606391-af01-487d-a526-855b56149c58","resolution":{"observed_at":"2026-05-16T00:26:21.382770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:2f2311d6949c4a8c8889b52f13757de287563331be680d5b6a9b8bf981378713","observation_id":"7554d3b9-a55c-47e6-babf-3ee709a2ed4a","resolution":{"observed_at":"2026-05-11T10:56:09.455699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T02:48:44.900467Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2411.04996"},"observation_digest":"sha256:46b5e28881b6b269905f5fd6311b8c2dc85f30b03ae69cb5a35426be2edf4095","observation_id":"5d99ca5f-b621-4cb0-8da2-388754be6df9","resolution":{"observed_at":"2026-05-18T02:48:45.089761Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-08T11:51:13.254591Z","title":"org/CorpusID:271855655","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07737","last_updated":"2025-02-12T14:50:50Z","snapshot_observed_at":"2026-08-08T11:42:31.651276Z","submitted_at":"2025-02-11T17:57:53Z","title":"Next Block Prediction: Video Generation via Semi-Autoregressive Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:13.254591Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2502.07737"},"observation_digest":"sha256:c4c94b57f29cca19cc149946a1c367551d9545fd910712e44f8c1b10ddf64c67","observation_id":"05b66629-7c06-48cb-b16d-cdbd42bfdf59","resolution":{"observed_at":"2026-08-08T11:51:13.254591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T23:51:43.934329Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2503.14324"},"observation_digest":"sha256:7df05fccc97c17ee1d6b3e5ace8899511ab320dbfa873addcefbe789c6400dcf","observation_id":"a911f41a-9533-4efb-ade8-38a6107d7050","resolution":{"observed_at":"2026-05-22T23:52:16.729035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:f1ab802ecfedff174c79d9b32aeebdebfe5ecca550b141269fe383a721def78f","observation_id":"1f6f407e-d188-444d-b36f-0b6e4a9b9b6d","resolution":{"observed_at":"2026-05-17T07:24:04.730499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T05:50:00.168507Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-08T17:13:59.793181Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.168507Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:93a5ac8fb1d1128eaacbec45793ea18eab02fe832c5c9a0a1772c23f433eac19","observation_id":"0349970a-a02d-4bfb-b826-ce4611bc89f9","resolution":{"observed_at":"2026-08-07T05:50:00.168507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T05:27:16.282820Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-07T23:16:48.649505Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.282820Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:f1111068c222b587942f92a2ba129b7158b3a4021eab19b6b330298e921577a4","observation_id":"cddd270a-1f4d-403d-a095-4b938064210e","resolution":{"observed_at":"2026-08-07T05:27:16.282820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T04:34:11.061508Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-07T04:25:14.940851Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:11.061508Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:d84471d59955a41562bc4cfa4217e3f1e1ad8c7995927cebe6829435d96ce495","observation_id":"e9b4edd9-af5c-4184-8228-db135bf16a19","resolution":{"observed_at":"2026-08-07T04:34:11.061508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-06T21:46:30.191271Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-08T08:02:50.830843Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:30.191271Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:f28997fdb86b354b754d77fa56fa602fc03329160fc2b32303661055d2324fd8","observation_id":"3e051434-6923-46ac-b071-f1409063ba81","resolution":{"observed_at":"2026-08-06T21:46:30.191271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2601.01593","last_updated":"2026-05-18T03:12:58Z","snapshot_observed_at":"2026-07-06T22:40:41.626783Z","submitted_at":"2026-01-04T16:46:13Z","title":"Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T16:57:09.843691Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2601.01593"},"observation_digest":"sha256:854a753caf639b15de273723c993d7ed4f5d7c0582c318ca389b6a1b72cf320c","observation_id":"a3d45e71-80cd-47f3-bbb0-101445996b39","resolution":{"observed_at":"2026-05-21T17:00:24.100992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2601.14671","last_updated":"2026-04-13T06:15:42Z","snapshot_observed_at":"2026-07-06T22:42:26.083572Z","submitted_at":"2026-01-21T05:33:23Z","title":"Mirai: Autoregressive Visual Generation Needs Foresight","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T12:16:16.461488Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2601.14671"},"observation_digest":"sha256:092ed2f60a12d871f9c067598a384da1cfffd577921ec236e27c95e764c93c98","observation_id":"c1c71beb-6d0d-4eec-b642-46710fa28895","resolution":{"observed_at":"2026-05-16T12:17:52.072386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-03T07:13:01.740855Z","title":"naacl-demo.37/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21081","last_updated":"2026-06-17T18:55:04Z","snapshot_observed_at":"2026-08-09T03:08:11.201090Z","submitted_at":"2026-01-28T22:07:17Z","title":"Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T07:13:01.740855Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2601.21081"},"observation_digest":"sha256:0f6db318573fb73eec9b31c0cde43f630230df5e66b0f2b28bc3c5b841d4ddb6","observation_id":"a8c6eaa1-d52b-47f3-9230-edd866b78180","resolution":{"observed_at":"2026-08-03T07:13:01.740855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2605.19227","last_updated":"2026-05-19T00:55:18Z","snapshot_observed_at":"2026-07-31T18:48:53.380189Z","submitted_at":"2026-05-19T00:55:18Z","title":"Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:46.236860Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2605.19227"},"observation_digest":"sha256:96c583b34961107c5243bfa344fb8584f94e61ed2d5b67c20d06dd6cbb64df07","observation_id":"6c18d0c1-30cf-445e-9666-814e7aa69a2a","resolution":{"observed_at":"2026-05-20T05:38:05.450573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2605.20316","last_updated":"2026-05-19T17:59:39Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T17:59:39Z","title":"FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T07:40:36.206754Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2605.20316"},"observation_digest":"sha256:fc5c34a7c6ff76510b4d60ed3fa6e3f3c6638757db96f6d3413382464e97fed7","observation_id":"eb19b34b-f87e-48c9-9918-9b17883db5ca","resolution":{"observed_at":"2026-05-21T07:44:03.082166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:e87dcab2f2d4eeccd243e5df5168a8c021443ab496d76ab5e1193cd2065d1fde","observation_id":"7533d770-7924-41f1-a666-d1af27ffe8ff","resolution":{"observed_at":"2026-07-03T10:48:03.002018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:25.661515Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:5e93738863517b12c891af817ae19d37a62d28440bc332c8fb26b19ef7f929e7","observation_id":"c5eac19c-a2da-47f4-9386-824529c178d0","resolution":{"observed_at":"2026-07-04T10:09:44.661419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-03T23:15:09.253879Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:d15dddd9f77669f3739953336963dd4fd78590ac7bfa494ce7dff322452456cc","observation_id":"b62c772c-45f8-4b51-b1fc-f3b5fa752002","resolution":{"observed_at":"2026-07-03T23:19:02.540114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2606.28643","last_updated":"2026-06-26T22:56:54Z","snapshot_observed_at":"2026-07-07T00:02:43.396508Z","submitted_at":"2026-06-26T22:56:54Z","title":"Obliviate: Erasing Concepts from Autoregressive Image Generation Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T00:28:37.837090Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2606.28643"},"observation_digest":"sha256:fa390fdb867d075bd5e8c1d5a5838b455fb0079d4327155de5b0365a1a1fa9d3","observation_id":"80d14c5e-5aca-41bd-bf26-dc472960ebc6","resolution":{"observed_at":"2026-07-01T16:35:50.633519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-07-14T15:55:25.318583Z","title":"arXiv preprint arXiv:2309.02591 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09776","last_updated":"2026-07-15T15:49:55Z","snapshot_observed_at":"2026-08-08T06:15:43.883473Z","submitted_at":"2026-07-08T03:03:38Z","title":"HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T15:55:25.318583Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2607.09776"},"observation_digest":"sha256:ada6fead875d2720997ba8ba12774b35bd9a8400b5a1d938255844e19d039a02","observation_id":"a6b91e9c-04c0-486f-8eba-a1f81998cbda","resolution":{"observed_at":"2026-07-14T15:55:25.318583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-02T08:13:03.762013Z","title":"arXiv preprint arXiv:2309.02591 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09776","last_updated":"2026-07-15T15:49:55Z","snapshot_observed_at":"2026-08-08T06:15:43.883473Z","submitted_at":"2026-07-08T03:03:38Z","title":"HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T08:13:03.762013Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2607.09776"},"observation_digest":"sha256:0e866f85ff27e14cc7a8dc4881ccff8547d6b77e6ef8d2a227ace0e380910e9a","observation_id":"6a7d5a16-0de4-403a-bb72-3732166dc2cb","resolution":{"observed_at":"2026-08-02T08:13:03.762013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-01T01:51:50.147250Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25642","last_updated":"2026-07-28T12:27:59Z","snapshot_observed_at":"2026-08-07T04:23:03.102990Z","submitted_at":"2026-07-28T12:27:59Z","title":"Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T01:51:50.147250Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2607.25642"},"observation_digest":"sha256:41c9653d9fd245d0793e529cc89e7e66e980de6dbfb8ca686f46598b2fa0fbdf","observation_id":"18ce830d-80e2-4c80-87b4-e5957605ca13","resolution":{"observed_at":"2026-08-01T01:51:50.147250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.02591/citation-record","integrity":"/paper/2309.02591/integrity","json":"/paper/2309.02591/citation-record.json","paper":"/paper/2309.02591"},"outbound":[],"paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2309.02591."}