{"as_of":"2026-08-15T22:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8dc20c32adb90089477c0252bb99542edcb7e7cae392a3ac50bcdc9a207892c","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:34:12.154340Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T19:17:19.634242Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T18:51:15.880853Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2506.10395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10395","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pisces: An auto-regressive foundation model for image understanding and generation","venue":null,"work_id":"277fb66a-52e9-4f2d-a884-d192518d39f1","year":2025},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2506.10395","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:2adab5d131f0eb940cb22512a5558f9e86ef160d7c3aed162ca60291602f196d","observation_id":"00f45ee6-cf2c-4edd-b665-fcf19c93116a","resolution":{"observed_at":"2026-05-12T18:51:15.884365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10395","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:2506.10395 (2025) 22 Kang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-04T06:57:07.480777Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2506.10395","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:0641c4573558d8a3dccc1a7a91086febc7555c55829f08c4533249e8fdcbc5da","observation_id":"98aa2f0d-0924-40d1-a253-9fb7348f8004","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10395/citation-record","integrity":"/paper/2506.10395/integrity","json":"/paper/2506.10395/citation-record.json","paper":"/paper/2506.10395"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:59.234925Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:59.234925Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:020c72a96d3985bf9e36dfc182cc2ea5f97a9b35754e475b145c34aab0aa9c63","observation_id":"eebf5b90-1bdb-45b1-a9e5-af521b65bd51","resolution":{"observed_at":"2026-08-07T04:33:59.234925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:33:59.321702Z","title":"https://arxiv.org/abs/2407.21783","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:59.321702Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:156d036be9119543198698677661a53109066bd8e48a9397d1a0f683c118af91","observation_id":"a020a70d-a6a7-4c98-9182-37b551e521db","resolution":{"observed_at":"2026-08-07T04:33:59.321702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07520","last_updated":"2022-01-19T10:45:38Z","snapshot_observed_at":"2026-08-13T16:57:02.527497Z","submitted_at":"2022-01-19T10:45:38Z","title":"CM3: A Causal Masked Multimodal Model of the Internet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07520","snapshot_observed_at":"2026-08-07T04:33:59.440871Z","title":"CM3: A causal masked multimodal model of the internet","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:59.440871Z"},"links":{"cited_paper":"/paper/2201.07520","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:55e45d9986ac1f314b505c3bd19a0281ef14c06b17ce390b32d95366cb9ac031","observation_id":"abc4ea03-17c9-4738-936f-47ed169a939d","resolution":{"observed_at":"2026-08-07T04:33:59.440871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:59.594642Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Kar \\' e n Simonyan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:59.594642Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:d7f6ad2513c57d10b1a8a30d45feddb582d3f0a876a7162a05e25db56dfe924e","observation_id":"28a22b10-b9cf-4c6f-9bdd-35e81f4db077","resolution":{"observed_at":"2026-08-07T04:33:59.594642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:59.735365Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:59.735365Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:1c7625bd844f658c5fba9635474e08e7767e82d419f6ab3a48d793ccc8e97ac1","observation_id":"9c6ba7fd-8ebb-4380-a453-fdc378c12828","resolution":{"observed_at":"2026-08-07T04:33:59.735365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:00.049480Z","title":"Kwok, Ping Luo, Huchuan Lu, and Zhenguo Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:00.049480Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:5ec5d51c0008640649b5bff6fbe676b7f642ffd9c88ce82dae5fca25eb3694ed","observation_id":"85ca09f3-7f82-4bec-868e-88e0543cf97a","resolution":{"observed_at":"2026-08-07T04:34:00.049480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-13T23:46:55.707976Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-07T04:34:00.161811Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:00.161811Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:3cb9836ee2da1d45df6642f0ecc394a17d606df8d192b46bebea326025abfc29","observation_id":"0f708b75-a8e2-4530-91a4-596384414343","resolution":{"observed_at":"2026-08-07T04:34:00.161811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T04:34:00.326020Z","title":"Sharegpt4v: Improving large multi-modal models with better captions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:00.326020Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:b37201f9f102821781593f623999c7d91ecb56fd81d9b5bad72d22e29c54c5c6","observation_id":"2af2ac08-d9d3-4a7e-823b-559c41fbd359","resolution":{"observed_at":"2026-08-07T04:34:00.326020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T04:34:00.478226Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:00.478226Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:fc9864e912b0f8f78a7f74463e20869287cc0421c808c49f84edd1314ac1f2ff","observation_id":"810f32d4-c9b2-4610-8376-0015a635568e","resolution":{"observed_at":"2026-08-07T04:34:00.478226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T04:34:00.637220Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:00.637220Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:53fc3b2a5831bb752f3f8df8dbdc88d162863d2bda4a705eea8ecaef5878f8da","observation_id":"fdd57776-9a51-47f4-9f03-ec46aa1e85e7","resolution":{"observed_at":"2026-08-07T04:34:00.637220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:00.829274Z","title":"Dream LLM : Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:00.829274Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:ee468effa9427bdae90de862fea3a841052c30360e885e478e4a87a952047297","observation_id":"282b3c3f-0bf0-434e-a7b2-4d2c58bc8d31","resolution":{"observed_at":"2026-08-07T04:34:00.829274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:00.945047Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:00.945047Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:a93209ab656a55d35165f3f2526179201261b9d6b0856b94b42215e18107f312","observation_id":"31c365d3-95ab-449f-a0bc-836c440bcaa2","resolution":{"observed_at":"2026-08-07T04:34:00.945047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:18.728605Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"cc5b9adf-c5da-4cf4-a935-0e619882ac2e","year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:01.070818Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:ee9f423536f6a7fc68b49aa694b604668709126a0c3b6edcc0a5164927b9e6d1","observation_id":"0a84b836-d5e9-4f8a-b917-d0214a4a70ce","resolution":{"observed_at":"2026-08-07T04:34:18.805912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:01.269001Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:01.269001Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:1214682856fb95bb0d94ca6247558d4fb10f14f10d9230b43ad34e379b50b2de","observation_id":"005b0f3d-381c-4faa-8df6-bd1e16f6c3e6","resolution":{"observed_at":"2026-08-07T04:34:01.269001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T04:34:01.423591Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:01.423591Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:08606cb8676a81d3764e593b77d806651980dfa3cf7d0c97c0de63d84ef8728c","observation_id":"dd691fa1-fb58-40bf-b061-aef520ac4b56","resolution":{"observed_at":"2026-08-07T04:34:01.423591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:18.533791Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":"a29e0517-ecde-4e9a-9137-7320c3d58d57","year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:01.595680Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:40f68bd7389db489896a33b4d4dc589c8f7d7e408a63c4c339176670f480e704","observation_id":"176c3921-7018-4cdd-8b03-1bf1c652af5b","resolution":{"observed_at":"2026-08-07T04:34:18.610344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:18.289760Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"40865bd2-90dc-411b-9f23-902b4aa712f7","year":2017},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:01.784116Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:5c7519826a2592f612a018e51d1bc91d1982cfbff9188b0dfeb85fd83e43879d","observation_id":"8d0a0171-406d-4d70-be15-7df991db1f82","resolution":{"observed_at":"2026-08-07T04:34:18.408391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:18.087099Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"31a874ff-d4f5-4b07-b1c5-a930a2a0cb34","year":2018},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:01.983831Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:4a701037cf57155e39319c906dbbb1cd0a59f31a102e1ced46f6d0855e66c47b","observation_id":"4cc5fe1e-282d-46d5-9df9-8d11ba897449","resolution":{"observed_at":"2026-08-07T04:34:18.190173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-08-15T19:53:40.614050Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-07T04:34:02.155166Z","title":"Girshick","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:02.155166Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:93569f0ccd4bc3daef467a3d39d84bdb3f29c1194e8193da816581fba42bff7c","observation_id":"3ecddb5c-dceb-48f4-9232-86434787a8e4","resolution":{"observed_at":"2026-08-07T04:34:02.155166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:17.877980Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"72eb5cc7-f21c-4bae-86b8-9e1c6d85fab6","year":2019},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:02.302887Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:4d468d996db3946e49a5c0a5a7c318deb170e3605b412d3cfa52eae461f00d36","observation_id":"29f63196-c174-40ca-bc2c-c11ce4af7382","resolution":{"observed_at":"2026-08-07T04:34:17.952933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2309.04669","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Unified language-vision pretraining in LLM with dynamic discrete visual tokenization","venue":"arXiv (Cornell University)","work_id":"4910c218-0968-4ac8-b089-99336f9f546d","year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:02.418863Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:1ca820819585602a6db5e8929b0ffa9f1f609800b7f6be0ef7cd68f814c6bd6f","observation_id":"c7a3e172-d7a5-4053-9f1c-a43cb76fc897","resolution":{"observed_at":"2026-08-07T04:34:13.304814Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:17.581496Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"89f264e9-7fba-4761-a044-76a27e0fff79","year":2016},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:02.539819Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:d2c5b10fe4a9e01d435664a878411a1686b646dad991d75442c36d0bd97feb1d","observation_id":"61a80a70-4b79-4239-9a52-ac12d2f74da1","resolution":{"observed_at":"2026-08-07T04:34:17.721711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:17.421399Z","title":"Generating images with multimodal language models","venue":null,"work_id":"98273f6f-625a-4812-8dcc-289b8a919729","year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:02.755733Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:0ed34aded60595ae70d6c55bdfa85081c083cefbb441449c3b63ae997f0a59c2","observation_id":"a52519a8-677c-4275-bdfe-737ef7d2a1d5","resolution":{"observed_at":"2026-08-07T04:34:17.490002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-08-14T05:34:49.617638Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-07T04:34:02.916132Z","title":"MIMIC-IT: multi-modal in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:02.916132Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:73a594bb4351ff338302dfe53aad57feb2ed555f01343c60750e5956c380e206","observation_id":"e870ab70-d91a-408c-ad38-3c090f0f4a8a","resolution":{"observed_at":"2026-08-07T04:34:02.916132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T04:34:03.070205Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:03.070205Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:58e1f6bf7079e5e74811712c055172614b65f5e51dc6f84c2971c5887b846593","observation_id":"79fde0c5-1a91-4e10-926f-c9d7b402a850","resolution":{"observed_at":"2026-08-07T04:34:03.070205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T04:34:03.206849Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:03.206849Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:7e43a8cdae425ee8bd3611cb293cc632bc62de5577d2822e9048b3d6f3613b5a","observation_id":"12899f82-3563-44a6-9a78-941a20b1afd3","resolution":{"observed_at":"2026-08-07T04:34:03.206849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:17.159431Z","title":null,"venue":null,"work_id":"d8395f6e-f513-4a6a-a4e2-33d48f43c053","year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:03.339774Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:e2ddd5f498d3ee1fc6a2a57100fbe9962d7342ce452a69af28c7147252e263f1","observation_id":"273f10d9-7205-4d87-8284-ca2e3c2ef32a","resolution":{"observed_at":"2026-08-07T04:34:17.290173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T04:34:03.476230Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:03.476230Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:32156a306e1055ca532f7a72bdbdc7196871350231d4e90264b2d7e2ac6d8ed8","observation_id":"9a25378b-887d-4c8f-b888-4c69caf597a7","resolution":{"observed_at":"2026-08-07T04:34:03.476230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T04:34:03.678107Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:03.678107Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:7f1f5fed6d1e79434e691ee596432e8cb453189ce5f330c98dec2b8f2d0aa883","observation_id":"e07f2fb3-48c4-46de-91da-d8bf02d63ddb","resolution":{"observed_at":"2026-08-07T04:34:03.678107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:03.799566Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll \\' a r, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:03.799566Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:e0d06a5f72f6db34b8c9c14716b8ff8f4f095b9d50281b7625fd257f75bf82d7","observation_id":"c4ad44f6-9d62-4bf8-baf6-b5e6f06e999c","resolution":{"observed_at":"2026-08-07T04:34:03.799566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-07T04:34:03.967311Z","title":"Hallusionbench: You see what you think? or you think what you see? an image-context reasoning benchmark challenging for gpt-4v (ision), llava-1.5, and other multi-modality models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:03.967311Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:61b6b859308a80c2317fd2a430ab407fbcbe1087693db18e1557ebcf4fc3b4f8","observation_id":"98e74cdd-e023-4e57-82bb-a755b74a2fad","resolution":{"observed_at":"2026-08-07T04:34:03.967311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T04:34:04.091274Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:04.091274Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:a9b7882d73538132f9e83029fa013a024f959a9cdaf97b19a0c20e52fbc38734","observation_id":"f8a241d6-d815-4b89-b308-3c81e11cf694","resolution":{"observed_at":"2026-08-07T04:34:04.091274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T04:34:04.316929Z","title":"Visual instruction tuning, 2023 c","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:04.316929Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:13f9edcd138516a71c24caf3d80a74c1b641afd8b279bc1fe3cae02d9be2d5db","observation_id":"fc9d2ee5-14e5-4b01-92b2-1e4f746c6f5e","resolution":{"observed_at":"2026-08-07T04:34:04.316929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:17.008362Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024 a","venue":null,"work_id":"8cfc62fc-9ad4-4026-9dad-03f90a355bc0","year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:04.448654Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:f09e51724f10683c62945d902065a6e3ead06b90e8646a45e7aa78b834a52ca3","observation_id":"aa3dcf34-721e-4f12-8389-df32b9d9580c","resolution":{"observed_at":"2026-08-07T04:34:17.057930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:04.568020Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:04.568020Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:9b6457bbc1bfff0ba0cf89087efb363fc279ff3b750e3f6a8352f6ac55220b99","observation_id":"ce5fc821-db12-452d-8655-ac7a47e1b085","resolution":{"observed_at":"2026-08-07T04:34:04.568020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T04:34:04.747893Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023 d","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:04.747893Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:428f1eaf0f7179da26672d94b5b8d4ac395cdee560f540e6f5319aebbd1eccf5","observation_id":"396b95b1-89d1-4a06-9d74-74649dc13acf","resolution":{"observed_at":"2026-08-07T04:34:04.747893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:16.909766Z","title":"On the hidden mystery of ocr in large multimodal models, 2024 c","venue":null,"work_id":"d28c03cf-6644-4897-abcb-b3be89ade0c2","year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:04.934626Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:b1eea249d0ab32250e0c75566014dfe3c15fb2814a9a88ee1e29673622e29c77","observation_id":"e6ea8826-9138-48fc-b20d-1235829373dc","resolution":{"observed_at":"2026-08-07T04:34:16.931157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:05.044523Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:05.044523Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:615522fe3cf13fc670e58edc9f39a99f8f7fa41386adf356b2ec26b5d0d5410a","observation_id":"74ab8d04-505b-4eb6-a6e8-66c7fc7cfcfe","resolution":{"observed_at":"2026-08-07T04:34:05.044523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T04:34:05.176742Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:05.176742Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:a25d01fe1179136651c7ec46ed7db70f80b39d5ba4fdf0b6f199f7535fda3420","observation_id":"b37d7701-e2da-4f1e-88e1-4496d035711c","resolution":{"observed_at":"2026-08-07T04:34:05.176742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-08-13T11:16:45.283010Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T04:34:05.315938Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:05.315938Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:8418a7222956bb0ba1134ec3f8189f99624f7e0ec4d974b0decb16332a9118c8","observation_id":"87ae0daa-a108-4529-bfcc-022c9b0aa4aa","resolution":{"observed_at":"2026-08-07T04:34:05.315938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:05.474321Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:05.474321Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:02d17225f46da2c0c982810f5abf73f455651f018e85afce3ba843ac3871fffe","observation_id":"f1179f3e-2376-42ea-8792-0760c0b39fc7","resolution":{"observed_at":"2026-08-07T04:34:05.474321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:05.634106Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:05.634106Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:1f4bfe69ba9ae418d519de37ec61fe746e6117fee1bcbf12bb46c8d43e6970b3","observation_id":"f0ddd885-f659-40fb-a918-8f9af08c3c99","resolution":{"observed_at":"2026-08-07T04:34:05.634106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T04:34:05.794775Z","title":"SDXL: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:05.794775Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:635e3785fda2659ac65f55898c935848deac972dec50a6b52fd5a9f889b4ce5b","observation_id":"2838699e-86a7-441a-b0b1-7da3caea2a41","resolution":{"observed_at":"2026-08-07T04:34:05.794775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:16.593942Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"3c666df9-8d55-4e20-8d6b-dae6a2ab2ae8","year":2021},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:05.937934Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:a0c24494f1e06efc512885ee7c48d1f01dafdbb33c0bde7ef17dbaca3e533122","observation_id":"c74be96a-30ec-4c99-aca8-4fa8592c5a13","resolution":{"observed_at":"2026-08-07T04:34:16.730462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:16.317030Z","title":null,"venue":null,"work_id":"42bd2a8e-ee72-4f6a-a2a1-27145d8fef4a","year":2020},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:06.067878Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:d03aeaa6d06f814c4dbc0122ab2232a50d1a1d43f1d4d3c6feaa5492409d49ef","observation_id":"20385547-d54e-4e6f-ad8d-2dfec6e24874","resolution":{"observed_at":"2026-08-07T04:34:16.439186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T04:34:06.226877Z","title":"Hierarchical text-conditional image generation with CLIP latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:06.226877Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:a12b77893c7d65e578ac064cdc783ad0b6c45c313ea15d181cec97126f2c1b18","observation_id":"04974964-d317-4823-be2f-d05af2983131","resolution":{"observed_at":"2026-08-07T04:34:06.226877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:06.371337Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:06.371337Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:30be2c1b9a4d4eb6aab091bcadaabc5701f5bd66bf448a58be2ceb5ca87905a3","observation_id":"607662ee-0c37-4bf5-a7bb-6f381a55fe69","resolution":{"observed_at":"2026-08-07T04:34:06.371337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:06.504245Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:06.504245Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:392d2dc9b194b98c94f3ef2efbbc3826bcd2762609a27740b3f0d8372bb2a912","observation_id":"143f32cf-f12e-4123-b98b-f3ab38e3a9b0","resolution":{"observed_at":"2026-08-07T04:34:06.504245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15896","last_updated":"2024-12-06T00:41:15Z","snapshot_observed_at":"2026-08-14T13:42:30.379173Z","submitted_at":"2024-02-24T20:15:31Z","title":"Multimodal Instruction Tuning with Conditional Mixture of LoRA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15896","snapshot_observed_at":"2026-08-07T04:34:06.624192Z","title":"Multimodal instruction tuning with conditional mixture of lora","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:06.624192Z"},"links":{"cited_paper":"/paper/2402.15896","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:f3ddfc541bde4da004a9c773982ae02da1ddff5456af2d66ec80765590b6dd14","observation_id":"1ee84ecc-3961-4ef5-a0ae-76d81a0a4246","resolution":{"observed_at":"2026-08-07T04:34:06.624192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:16.025165Z","title":"Towards vqa models that can read","venue":null,"work_id":"84833f42-49f4-4469-a3b2-349abda0b4f7","year":2019},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:06.792015Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:800f73c0ee03cf83a842223b317d91263d9274eb882296b17040d2abb05d09d6","observation_id":"ec43e49d-4005-475c-9c85-60df80513c47","resolution":{"observed_at":"2026-08-07T04:34:16.178169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T04:34:06.956907Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:06.956907Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:5fa603c702671bacb3f33d7bd86948db6fb6d87cdb947820af533d26ca485944","observation_id":"b455ec78-c8a9-44bc-9ca5-25d79365c58f","resolution":{"observed_at":"2026-08-07T04:34:06.956907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-15T01:20:03.559618Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T04:34:07.113869Z","title":"EVA-CLIP: improved training techniques for CLIP at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:07.113869Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:581ec6aafc00453f64d29279c9febde035d6b499267545eeed9e73286434329f","observation_id":"b6fb765c-2f9b-4a37-8260-721aab517faa","resolution":{"observed_at":"2026-08-07T04:34:07.113869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-07T04:34:07.236721Z","title":"Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:07.236721Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:41d40220d0b47991f789de007394c78908b8dc9e611617fbb90c906c8bf563cb","observation_id":"b107e098-ca99-4fa3-9c50-ba1aa94d0951","resolution":{"observed_at":"2026-08-07T04:34:07.236721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:15.679631Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"e7b8464d-b6e8-4e6c-9f4a-3745646a33d1","year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:07.381855Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:d9217b4197267353fbf4e9eb3832d3c55719589897d7a1a86441cdfa9ddc79c7","observation_id":"9157b874-4a5e-4133-bc4e-ebce19cfbb08","resolution":{"observed_at":"2026-08-07T04:34:15.826498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18775","last_updated":"2023-11-30T18:21:25Z","snapshot_observed_at":"2026-08-14T16:32:44.634757Z","submitted_at":"2023-11-30T18:21:25Z","title":"CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18775","snapshot_observed_at":"2026-08-07T04:34:07.537541Z","title":"Codi-2: In-context, interleaved, and interactive any-to-any generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:07.537541Z"},"links":{"cited_paper":"/paper/2311.18775","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:1f71111d1d67b009b25bd8c525b6680d0d95eefac9606a4d84cff6d1b21817e5","observation_id":"b6b0a231-7596-49d1-8b53-45a7d0f0e3ad","resolution":{"observed_at":"2026-08-07T04:34:07.537541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:15.372153Z","title":"Any-to-any generation via composable diffusion","venue":null,"work_id":"a3025744-038c-41ea-9d6d-e586b5787a2b","year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:07.678452Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:c3e9bab0f3d10a116eb36066665c75e2d091405b2996d2425e74aacb5967fc8d","observation_id":"ff032ef9-9d8c-4eac-9f1c-0536508ec074","resolution":{"observed_at":"2026-08-07T04:34:15.538723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:07.871098Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:07.871098Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:7b453c095494e936484cd02aeac890ee762c0353a3013c122cb3736c24c3e87a","observation_id":"f3aefd29-efa1-4137-8cf6-000253965e3c","resolution":{"observed_at":"2026-08-07T04:34:07.871098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-08-15T20:08:59.451983Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-07T04:34:08.000903Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.000903Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:2c915da99569f65c491646dc19fadb97c16343ca6e927edbb76178bf08a446b3","observation_id":"ff2de168-136a-4a9c-a1e1-8385b4d6a2fe","resolution":{"observed_at":"2026-08-07T04:34:08.000903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T04:34:08.124461Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.124461Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:0c50eec4be7bbb457bdc86323fbb3985dd050a549747e1b4448122c8aff130da","observation_id":"0129f496-dcae-4c81-bc71-311c6cc4aecf","resolution":{"observed_at":"2026-08-07T04:34:08.124461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:15.067690Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"c1454c1f-e791-4ea5-8212-fb09cdf65b76","year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.316611Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:db44aa72555b025c65d81dc8a8d175362c51862b9936702310519c00990ebc89","observation_id":"0b5b9bf6-2cc9-4da9-b2db-d3b84535404f","resolution":{"observed_at":"2026-08-07T04:34:15.221743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:34:08.477979Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.477979Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:d09ffdeea5fd276ba51540e812896a971a43887df3fef271b6146ba77a6b29cb","observation_id":"969ed406-5d8c-4ea7-9be1-56d92ad587cb","resolution":{"observed_at":"2026-08-07T04:34:08.477979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T04:34:08.648626Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.648626Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:a131028fc3a02cbb93a26de7f7ef3b9da5d44eac8de856d11aa8ec1be14b484b","observation_id":"0ffe2784-43c0-407f-87e9-88ba41cf170c","resolution":{"observed_at":"2026-08-07T04:34:08.648626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-15T03:50:59.768240Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T04:34:08.755303Z","title":"To see is to believe: Prompting GPT-4V for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.755303Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:7f6e20ebb5685cd450ace88157c346445e0579077089e038092ce2ac5140a0e7","observation_id":"7d658a2d-493f-4c3d-8b4e-c7ef1a5e2a14","resolution":{"observed_at":"2026-08-07T04:34:08.755303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:14.824732Z","title":"OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"bb11eee6-77c6-46b9-a7e9-91460f0173aa","year":2022},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.885112Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:c7fc1bafa14610a36a627780a4c0060db0e4fd2fa8b5945981836314f6452fa5","observation_id":"2219aa29-5f93-4240-afd0-11434893aa1e","resolution":{"observed_at":"2026-08-07T04:34:14.903752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:09.022182Z","title":"Image as a foreign language: BEIT pretraining for vision and vision-language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.022182Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:ba4d24afec793eac36f4e39969abbfda38b04977b8e24abe6f4585b41b7330a7","observation_id":"7c8c064b-8e4f-45de-9a24-3a57bbc9bddb","resolution":{"observed_at":"2026-08-07T04:34:09.022182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T04:34:09.192768Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.192768Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:452865c09f0e9d9699138100e9f1c9f1dc79e85df78e4a8c1f785dc7a4e61b8c","observation_id":"1d99262d-5b9d-4c38-be12-0575e788c3eb","resolution":{"observed_at":"2026-08-07T04:34:09.192768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T04:34:09.374451Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.374451Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:14f909ff71def1018b71d7b75a3070ab42cf6e4678ee992bdb922dd9537c2ff7","observation_id":"974ce6fa-37c5-4c72-883f-1f57d968f342","resolution":{"observed_at":"2026-08-07T04:34:09.374451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-14T02:26:17.829525Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T04:34:09.517877Z","title":"Next-gpt: Any-to-any multimodal LLM","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.517877Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:6fdb80adbc587e53b11336aa80deac2a41841855c5060ec4b44f6ea3ca710862","observation_id":"d18c754e-cc81-41f7-95a0-bf11ed74dfb9","resolution":{"observed_at":"2026-08-07T04:34:09.517877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:14.623055Z","title":"Grok 1.5v: The next generation of ai","venue":null,"work_id":"9208a32d-ad12-498f-810c-638720bf9dd9","year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.703995Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:e3b6722ef56de55cf76ef9dcd08b5dea5e3cd2691f88b5111f31e6b858aa5bd8","observation_id":"aa67e46c-d63e-481c-8fef-55eceba2b082","resolution":{"observed_at":"2026-08-07T04:34:14.727112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T04:34:09.844460Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.844460Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:c7c10e6f732695a8e0de655be4cbf49d7758edbb09855dd7585b473a2fb138e8","observation_id":"ff7c1f67-5593-4f19-ae75-b98806a9f200","resolution":{"observed_at":"2026-08-07T04:34:09.844460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-13T00:51:59.402203Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-07T04:34:09.966497Z","title":"Llava-uhd: an LMM perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.966497Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:eff2d9130439fc4ec0dbfc4679f847736d91824aa7ef50b186a5afdd75e660b8","observation_id":"d30a2810-ca8f-4506-841d-cab57a499d09","resolution":{"observed_at":"2026-08-07T04:34:09.966497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.641","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Multiinstruct: Improving multi-modal zero-shot learning via instruction tuning","venue":null,"work_id":"fdf534fe-c05b-470c-868b-1042b0083e06","year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:10.109785Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:651c088b68cd89607a3e6d77472134f99f2642058ed1005751a04af3cdce2240","observation_id":"877fdd3f-effc-4341-8f7d-aee0f9d1ff3a","resolution":{"observed_at":"2026-08-07T04:34:12.568692Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11690","last_updated":"2024-02-18T19:38:44Z","snapshot_observed_at":"2026-08-14T13:59:48.966916Z","submitted_at":"2024-02-18T19:38:44Z","title":"Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11690","snapshot_observed_at":"2026-08-07T04:34:10.263657Z","title":"Vision-flan: Scaling human-labeled tasks in visual instruction tuning, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:10.263657Z"},"links":{"cited_paper":"/paper/2402.11690","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:12d95dff9a2cc87e9a14d8e7058489ac84e21b4e9afa95bc90c5c7f00868d170","observation_id":"60240428-c3d7-42de-b785-8280a413f474","resolution":{"observed_at":"2026-08-07T04:34:10.263657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:14.339155Z","title":"Modality-specialized synergizers for interleaved vision-language generalists","venue":null,"work_id":"3ab2c877-f860-42c9-ae40-e3d207ef020d","year":2025},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:10.391353Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:20b523b4b5f7c5cabe636dc9371139da6e2a74951c4af077106abb1e82e6b16b","observation_id":"1cd2c1f0-cfcb-4753-a007-e055acbfb868","resolution":{"observed_at":"2026-08-07T04:34:14.442097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:14.111713Z","title":"Retrieval-augmented multimodal language modeling","venue":null,"work_id":"8f2ddb06-e1a6-4d2a-b88d-e612e5708fe0","year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:10.582907Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:d5c64f2c3ab1a0adb4691299dfd7103186e4b9603687dba42c2d93803286ca90","observation_id":"8f22ff07-7612-4a2a-b947-666c44328754","resolution":{"observed_at":"2026-08-07T04:34:14.215441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T04:34:10.749553Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:10.749553Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:c1f1af303cdf7241db037fc4e9653c028411676ed26b291d4839378b130fe28a","observation_id":"e7c6d5cf-9f27-42b2-ad58-643a88ed7b46","resolution":{"observed_at":"2026-08-07T04:34:10.749553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06687","last_updated":"2023-11-06T07:02:19Z","snapshot_observed_at":"2026-08-13T11:19:29.069742Z","submitted_at":"2023-06-11T14:01:17Z","title":"LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06687","snapshot_observed_at":"2026-08-07T04:34:10.895265Z","title":"LAMM: language-assisted multi-modal instruction-tuning dataset, framework, and benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:10.895265Z"},"links":{"cited_paper":"/paper/2306.06687","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:51b1a16ba4dce5804e164d5646013c5872121cbc2f82034f3882a13f9e805af9","observation_id":"eb2dfaed-8279-4d42-9cac-c2fa98baea49","resolution":{"observed_at":"2026-08-07T04:34:10.895265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-14T13:35:07.349897Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T04:34:11.061508Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:11.061508Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:9a46fe8d6e7a49ecea20c9b91a5b59371a59732eaa71e0c9f5bc904acaaf6490","observation_id":"e9b4edd9-af5c-4184-8228-db135bf16a19","resolution":{"observed_at":"2026-08-07T04:34:11.061508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T04:34:11.250107Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:11.250107Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:f68974ad398cf0a4d37950ac0c80f96b47cf5bd5b668b1709293893562cfa395","observation_id":"825db274-4934-4ccb-9e22-98aa3e98a425","resolution":{"observed_at":"2026-08-07T04:34:11.250107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:11.405831Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:11.405831Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:6cb96f7b8e74ff40db7abc51cf784be937c848c2f1d18b34cd3e14b052817d5b","observation_id":"12e13317-6f53-4ab6-ad1b-3267e3526906","resolution":{"observed_at":"2026-08-07T04:34:11.405831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:34:11.533516Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:11.533516Z"},"links":{"citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:6bb1373ebd1a61951972539aa248612f2711a48d89bdda3261ef848abf0184bd","observation_id":"1f35042e-3a44-45ce-86a2-9093cc06b9a2","resolution":{"observed_at":"2026-08-07T04:34:11.533516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-08-13T04:15:20.480186Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T04:34:11.720293Z","title":"Anygpt: Unified multimodal LLM with discrete sequence modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:11.720293Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:19320142020c5024c4d13d4926d2d4d2a993e0c6a71030c04fd93a9e7250a927","observation_id":"c35cc7c8-52e8-4e1f-897b-b484e3188537","resolution":{"observed_at":"2026-08-07T04:34:11.720293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T04:34:11.878440Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:11.878440Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:29dd1dbe059d6d06e0fc12925b34c75af0a3adfac66137542ee644c76ea3a5bc","observation_id":"1137c489-997b-411f-82db-76314dc056c9","resolution":{"observed_at":"2026-08-07T04:34:11.878440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T04:34:12.006826Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:12.006826Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:67c084da92b5a50235ec61852d279ad4c40fae324436316775043e8568072b6e","observation_id":"df24cd45-8a6c-4865-9926-9dcdf3affe65","resolution":{"observed_at":"2026-08-07T04:34:12.006826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-14T17:39:36.185216Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-07T04:34:12.154340Z","title":"VL-GPT: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:12.154340Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:39354a4ee0baf3b007106dcf6c1b34da9bc13ba8256c4f9654a9e39ab61e0cb6","observation_id":"9c091c59-76f3-4992-bda8-50607a9d87c7","resolution":{"observed_at":"2026-08-07T04:34:12.154340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 2 inbound Pith citation observations for arXiv:2506.10395."}