{"as_of":"2026-08-13T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6d2a8c75f61fbe5c85f5932ae5d2399b40c32fd1926ed085762b9f9368fad40","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:58.783069Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T23:28:46.879238Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"cited_work":{"arxiv_id":"2505.19422","doi":"10.48550/arxiv.2505.19422","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19422","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llamaseg: Image segmentation via autoregressive mask generation,","venue":"arXiv (Cornell University)","work_id":"d18e359d-55d6-4edf-b259-0c86229513b7","year":2025},"citing_paper":{"arxiv_id":"2606.22660","last_updated":"2026-06-21T20:30:41Z","snapshot_observed_at":"2026-07-06T23:57:28.172988Z","submitted_at":"2026-06-21T20:30:41Z","title":"Prompting Diffusion Models for Zero-Shot Instance Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T10:43:15.465858Z"},"links":{"cited_paper":"/paper/2505.19422","citing_paper":"/paper/2606.22660"},"observation_digest":"sha256:e8dda97cddaa7605dbbff8fe6b338302125e1c43525c0984b5862dc9a4566e6c","observation_id":"9a13edfd-1395-4bfc-9ef3-7f64a467d600","resolution":{"observed_at":"2026-07-10T00:18:40.812535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"cited_work":{"arxiv_id":"2505.19422","doi":"10.48550/arxiv.2505.19422","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19422","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llamaseg: Image segmentation via autoregressive mask generation,","venue":"arXiv (Cornell University)","work_id":"d18e359d-55d6-4edf-b259-0c86229513b7","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-08-13T03:40:06.714401Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.19422","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:4c9597e37212afaf75c9a03bde4580289354c1c4392c5f54a9d0f65ed728b7c2","observation_id":"acd73b69-4fdd-43b3-8771-fa81727d664e","resolution":{"observed_at":"2026-07-10T00:18:40.812535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"cited_work":{"arxiv_id":"2505.19422","doi":"10.48550/arxiv.2505.19422","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19422","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llamaseg: Image segmentation via autoregressive mask generation,","venue":"arXiv (Cornell University)","work_id":"d18e359d-55d6-4edf-b259-0c86229513b7","year":2025},"citing_paper":{"arxiv_id":"2607.00015","last_updated":"2026-05-26T02:29:24Z","snapshot_observed_at":"2026-08-08T06:20:33.689645Z","submitted_at":"2026-05-26T02:29:24Z","title":"Towards an automated AI-based framework for floor plan compliance checks for residential buildings","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-02T23:28:46.879238Z"},"links":{"cited_paper":"/paper/2505.19422","citing_paper":"/paper/2607.00015"},"observation_digest":"sha256:ea7c19bf6a16facb90c587847521d0c45dd25f20e6b5cddfd8607d0f2a7f611f","observation_id":"1441080c-8ba2-44d6-b1a4-cc3473f12a76","resolution":{"observed_at":"2026-07-10T00:18:40.812535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19422/citation-record","integrity":"/paper/2505.19422/integrity","json":"/paper/2505.19422/citation-record.json","paper":"/paper/2505.19422"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:48.765134Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.765134Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:709b11d82696d57ec4db9022035621b9f499556728e66329eb72c83927da9917","observation_id":"623c40c9-214e-4fa2-a520-3b27fb5e0b64","resolution":{"observed_at":"2026-08-07T14:18:48.765134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:05.419111Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"913b286f-20c1-409f-ad8f-b0e1bc71999d","year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.914096Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:5f96ea00e08b0dffc4ce1cd6aba4cc46a777ada3269771faac11b96edd297670","observation_id":"9dcf6b2f-59a7-42ed-a7cb-9a1c7ec7e0f2","resolution":{"observed_at":"2026-08-07T14:19:05.575503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-07T14:18:49.060461Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.060461Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:ddff6393f0a0a133bc1f7a693ab13787c3994584a65ff35d676b8eb60393d47e","observation_id":"ad4dcc7b-8d3c-4721-868a-1ac35484542d","resolution":{"observed_at":"2026-08-07T14:18:49.060461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.248645Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.248645Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:3f50f855bd725c52d9f5ba3fbc61120bdac742e43fbf8fcb2a04e1dd358230c5","observation_id":"3953b53e-9e4c-4a3f-9a3f-b5b254c81aef","resolution":{"observed_at":"2026-08-07T14:18:49.248645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:05.151291Z","title":"u-llava: Unifying multi-modal tasks via large language model","venue":null,"work_id":"bf949e8c-0d82-4d29-9ecf-6fa7bc716e73","year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.357629Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:fa16d0354de6851c72ecd5d40b860576d11da8e97bff7a30208af38b19163709","observation_id":"69a2b8a6-1ccb-4816-934a-7046e61ce2e3","resolution":{"observed_at":"2026-08-07T14:19:05.285437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:04.937108Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"444e407a-5642-484f-accf-bd73fb964e48","year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.508094Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:3ef2cd9a2a74c15376b20f45c8e91779d393fd9471f5d1581ca85e90835500cc","observation_id":"f390e4d9-901a-4de4-a06d-b1b5e7ec3a95","resolution":{"observed_at":"2026-08-07T14:19:05.030481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.688885Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.688885Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:7162e971dd1e0672602971faed8460054f5ec1d237c2ce0dc6b39cb16915a0df","observation_id":"8704cb23-df55-4a38-8c1d-25b18d87cb06","resolution":{"observed_at":"2026-08-07T14:18:49.688885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.820249Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.820249Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:7d97bbea158375fa790dbbf112a9f0f3212fdb8858d366f91f604801b36604c7","observation_id":"32bea79f-30e9-455d-840f-11c34eafb280","resolution":{"observed_at":"2026-08-07T14:18:49.820249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.950170Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.950170Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:9c6fef48e7fa4a52b05794e821ad7347972b157e22a20cdc4d17327722c217c4","observation_id":"2c526dc8-57f1-4047-9239-89c4817eb0ef","resolution":{"observed_at":"2026-08-07T14:18:49.950170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09855","last_updated":"2025-02-17T05:35:12Z","snapshot_observed_at":"2026-08-13T17:45:29.422202Z","submitted_at":"2024-10-13T14:28:16Z","title":"Text4Seg: Reimagining Image Segmentation as Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09855","snapshot_observed_at":"2026-08-07T14:18:50.127833Z","title":"Text4seg: Reimagining image segmentation as text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:50.127833Z"},"links":{"cited_paper":"/paper/2410.09855","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:5cb2b8b6e9b1935156c0d32bec01430edcdc943c3a350c9d64a0e40cd2492b5b","observation_id":"5430b6d1-ba48-4a40-8fdb-096520526187","resolution":{"observed_at":"2026-08-07T14:18:50.127833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:04.585229Z","title":"Git: Towards generalist vision transformer through universal language interface","venue":null,"work_id":"be9102aa-a67f-43b0-bd61-1242d6ad2200","year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:50.295316Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:232821508af7a3efd456e253e007f0a94e86b0b2e5f6d4b9e71d6c19168db9a5","observation_id":"76f4e1fc-a9d0-4370-b774-b79e204a20a1","resolution":{"observed_at":"2026-08-07T14:19:04.723255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:04.290268Z","title":"Polyformer: Referring image segmentation as sequential polygon generation","venue":null,"work_id":"7507f4b1-e189-4cc3-a29e-a5209e9ab75c","year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:50.454556Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:0ac26353b3a8800b2e4083a135d1735296b5b61a7798621725c185f66eb50c02","observation_id":"23f8c6b0-2607-469a-abe7-e9a42461feef","resolution":{"observed_at":"2026-08-07T14:19:04.457501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:04.013150Z","title":"Jack of all tasks master of many: Design- ing general-purpose coarse-to-fine vision-language model","venue":null,"work_id":"6e67c3d2-8dd6-4430-a908-247587438908","year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:50.622727Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:1b98c0daa83eba77125dbfcfbb8f4716bedebdf9aef6f8eadfb9e55bd28c2074","observation_id":"ce8ab02f-10ec-4b1e-97c8-8968d8748a48","resolution":{"observed_at":"2026-08-07T14:19:04.159697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:03.767532Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"d7d8ecf1-b9b1-4c50-aae3-f74e82b37fbd","year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:50.777068Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:77f598b2d6b71fb60faa0e5cd5ffb400f3a11f7285751a9bf7f59afd6e4aceda","observation_id":"6f1e769f-81df-49cc-945f-c5d91ad441a1","resolution":{"observed_at":"2026-08-07T14:19:03.877209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:50.924925Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:50.924925Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:02aab3c62f21e7e71b9676c7e957b8c6e1a3fe82e48d25ed92e205c1fe89f2bb","observation_id":"a7b7b965-8d84-49f2-b43e-ed3c4c9d2b08","resolution":{"observed_at":"2026-08-07T14:18:50.924925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:51.038586Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:51.038586Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:aa92539bd76419bd2df29057aced6f3900da292c4aa5db9481fc9cc566f0fe89","observation_id":"a694bd22-80c1-4772-98f6-cb27f8dc1ff1","resolution":{"observed_at":"2026-08-07T14:18:51.038586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:51.218501Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:51.218501Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:e505d2d590b0eeacb42a46a3cd0e6439f70c2ed9453ec142e7b6ae67f9a2b2f9","observation_id":"38cbdd2d-192c-4889-b6a8-e42843b6f85b","resolution":{"observed_at":"2026-08-07T14:18:51.218501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:03.557449Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"5874612d-42ec-4049-bca0-e312d5cdb3cd","year":2019},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:51.335353Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:4d3bcd9078d6ff6192d6045a2cf6887a73d34896c63d810026eedce3bf32fa5d","observation_id":"3aa89c91-a4c1-4e9d-924c-79ec84744fa5","resolution":{"observed_at":"2026-08-07T14:19:03.612443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:51.457069Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:51.457069Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:4741e90e0006c81ee4b7229417cdb4e066da6a9130dd6b862c354e2ddc1e5c2a","observation_id":"2754b107-31e3-4cd9-9572-3de20abc23c6","resolution":{"observed_at":"2026-08-07T14:18:51.457069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-12T17:57:54.262483Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:18:51.591027Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:51.591027Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:6ef7a952f0a891da6d263ecaba7bf047f2297187b5a333fa406154259e2d53e3","observation_id":"df5cb931-d91c-41d7-9709-d37dccc99a3b","resolution":{"observed_at":"2026-08-07T14:18:51.591027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:18:51.761106Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:51.761106Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:ab994be7decf7af2587b3af03dd529c91785725b24fe4d123dcaa38ed1a377e9","observation_id":"7bc3d74e-3129-4502-90d2-5e4a7c94b055","resolution":{"observed_at":"2026-08-07T14:18:51.761106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:18:51.877240Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:51.877240Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:4c8ebdcbeeab7cfd4d7ccdd71e86810b62e97da034c8367e8585352ba21a9117","observation_id":"7f91fb34-e4f6-4900-9543-f5120dcab32c","resolution":{"observed_at":"2026-08-07T14:18:51.877240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.064538Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:52.064538Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:a2adf3933083c2aae6a56a3fa6bea74da339e0a48dbfd55d43aad0f010cc4f10","observation_id":"a10450b4-5556-455a-86d8-ef18a1e8fa32","resolution":{"observed_at":"2026-08-07T14:18:52.064538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.224782Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:52.224782Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:60bd68f77c43735f9e1a5a0799d593db342af7de0d02104296ab187ea529fb8f","observation_id":"db3d08a4-bb40-4a73-b981-1a535471611c","resolution":{"observed_at":"2026-08-07T14:18:52.224782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.336596Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:52.336596Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:827f5a7857b58886de36fa1b9c3a325a7c9b43c91cc99bf781ee41858a9ca3ee","observation_id":"b3c316b4-94f4-47dc-88d4-9ff1e9daa74b","resolution":{"observed_at":"2026-08-07T14:18:52.336596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.477997Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:52.477997Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:729736bad0f2b1e723fa34f6d93f868676955cb8982c33f07ea658497bd29f50","observation_id":"c4218a2b-b437-4ea8-90f8-21432545ca16","resolution":{"observed_at":"2026-08-07T14:18:52.477997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.589135Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:52.589135Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:64ef6c637113e9166357e284aebcd2dacf8387c813566e03fd51f77c3ef76b73","observation_id":"28da60b8-52af-4cbb-aab5-c0c1a7597ab2","resolution":{"observed_at":"2026-08-07T14:18:52.589135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.742201Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:52.742201Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:a2b22f1c5ee16dc084df22cd42d4a1fda03271f5facb69f6f202f50f0ba4e3a4","observation_id":"7d3435b4-2434-4c01-b521-67d0c81911a6","resolution":{"observed_at":"2026-08-07T14:18:52.742201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.902659Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:52.902659Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:be220c2b2ef5b94aef9843179f3883b15bbaaaf7333f7c6997579da2d9617f78","observation_id":"4ffcabb1-f4f2-4be8-a4d5-82edf36b0c4f","resolution":{"observed_at":"2026-08-07T14:18:52.902659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.079223Z","title":"Visual instruction tuning.Advances in neural information processing systems , 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:53.079223Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:b44f6830676a02ee99abd3799a0c4980965e5b81aff8d6b81eec91316f5d104d","observation_id":"37bff697-7b0e-4354-a191-617cc4e3d316","resolution":{"observed_at":"2026-08-07T14:18:53.079223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.272244Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:53.272244Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:26f39d090b0f223ae11a9ab2fd87e8a2de58f64ac3ba7a454b83ccebba6affde","observation_id":"f3fc05cd-94a9-4966-a4be-fef7035f58d6","resolution":{"observed_at":"2026-08-07T14:18:53.272244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:18:53.373312Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:53.373312Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:21966f93a4c71bba99d031816beb75eccfea4ed1e6af15ca845d661394264356","observation_id":"9c0e5efd-d244-4cbf-834a-2e22166b6fe6","resolution":{"observed_at":"2026-08-07T14:18:53.373312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T14:18:53.498373Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:53.498373Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:d074f6e5e4f6be3d7186c01c590b7a475eee6b666b73025143146a33bc679a2d","observation_id":"778a211f-b458-490b-8669-8af288f77ece","resolution":{"observed_at":"2026-08-07T14:18:53.498373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:18:53.654071Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:53.654071Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:92ea2ca58f1d55598f09544072de566eb282880d2a56db562683da4f79fa2628","observation_id":"67503526-5313-413c-9f3b-e9846bdf4c35","resolution":{"observed_at":"2026-08-07T14:18:53.654071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:03.208316Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":"2591cfdc-294f-471f-9e38-c51d838dfd82","year":2021},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:53.841047Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:0fda0344f6b7a9efddc3e39fac68c185e3715ce4e58593c968e3367a8eb5d804","observation_id":"bc4dbb58-1eb3-4735-a636-3454e1bc0e3c","resolution":{"observed_at":"2026-08-07T14:19:03.335852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:02.972570Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers","venue":null,"work_id":"2bb62505-be08-4158-8fed-0434f5a309ce","year":2021},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:53.964977Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:cd571ed402742804e1e14d949c9405e383cab59e735e9639769a8bb9555429cc","observation_id":"19ede363-d424-4c61-add1-4794e31cb037","resolution":{"observed_at":"2026-08-07T14:19:03.067538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:02.657093Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"81284096-5bca-4716-a33f-720b40bd2000","year":2019},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:54.105161Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:892f6040281efcfa7cf463258b84b552174087a4ac95b357f272bf5f8282b2a4","observation_id":"86e01068-3a53-4f58-9c6f-1d3e6d932ddd","resolution":{"observed_at":"2026-08-07T14:19:02.806222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:02.325579Z","title":"Vision-language transformer and query generation for referring segmentation","venue":null,"work_id":"a25a5956-507e-41e8-9a78-dbe2442d0f30","year":2021},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:54.320451Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:09011f634fd4dfe3624778a9f709c32df94a3b91431ffa52d9672aae0bbf8dd2","observation_id":"7040646a-69a7-4de8-94d8-54fc8a91c106","resolution":{"observed_at":"2026-08-07T14:19:02.504780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:01.984825Z","title":"Cris: Clip-driven referring image segmentation","venue":null,"work_id":"0e15f26a-3d71-4dda-90db-bc57db9dbc47","year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:54.477855Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:4eac270ef614cc32c2e9d9744a15dc53ace9d495698ed8f95764ee2aa01bdace","observation_id":"336a06b2-7b56-4ea6-844f-9e747b18ab12","resolution":{"observed_at":"2026-08-07T14:19:02.165503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:01.737771Z","title":"Restr: Convolution- free referring image segmentation using transformers","venue":null,"work_id":"495653c0-a81f-4f40-bfbf-dc0d19d8d9ff","year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:54.628990Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:75cb1c92c77e0cfbe34aeb0b5bf485a9711a15769a2524ea77152d0490bf35ac","observation_id":"e8044630-6258-44fc-94f5-c111eaddc3cc","resolution":{"observed_at":"2026-08-07T14:19:01.859025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:01.450833Z","title":"Gres: Generalized referring expression segmen- tation","venue":null,"work_id":"8da7bad6-7a15-4ed2-975a-aae7f43899d2","year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:54.809115Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:2e8fdfc6e25334127d4b2454816b7b5224b5b740d278598b4d0e96406deea488","observation_id":"a41cf8c1-127a-4aa8-bca1-6ada93eab595","resolution":{"observed_at":"2026-08-07T14:19:01.579004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:54.960384Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:54.960384Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:f6d1deefe4b2915d86528eb774d8ec31911c41b45711ce8b003761bb82b41dc2","observation_id":"abd4dfea-31d3-4e2e-8979-37aecf7ebbfc","resolution":{"observed_at":"2026-08-07T14:18:54.960384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:01.030951Z","title":"Generative semantic segmentation","venue":null,"work_id":"aacaddc5-d421-4137-88e1-0f85da1fbb8b","year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:55.096922Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:5268c0028b62cabfa38621ea5644cc34fb4e30565cc9b1117c317b6374551f2a","observation_id":"f127ebe1-442f-4a9c-8b4f-6c0ce9a41818","resolution":{"observed_at":"2026-08-07T14:19:01.224061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:00.710884Z","title":"All in tokens: Unifying output space of visual tasks via soft token","venue":null,"work_id":"c8e8e89a-44c4-47f6-9247-3fc066e14747","year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:55.239331Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:72e6004ca62306e585e6174be2082ddc59615290335f44bacb9a08483bedf7dc","observation_id":"c632f009-f28c-4ec8-a450-770c44e795a9","resolution":{"observed_at":"2026-08-07T14:19:00.848461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-08-13T15:21:53.358272Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T14:18:55.397888Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:55.397888Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:810852f35e46940af9233a771b731a5e55f54d0f825999cbd8cc99b4a4cc0392","observation_id":"e685d759-ba8f-47d8-b3a2-b88bacd1eddc","resolution":{"observed_at":"2026-08-07T14:18:55.397888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:00.459096Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"9cff3edc-f488-47a5-b865-47bb154621f7","year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:55.554486Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:0bc07ef07819954fca24447f528afff5cb034c014fc9c0571f77585e2441e7d6","observation_id":"576d1f19-6221-437a-8a5b-eeba8c509471","resolution":{"observed_at":"2026-08-07T14:19:00.528506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-13T13:45:12.888881Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T14:18:55.721329Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:55.721329Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:16e39037d82a71847effe6f9a918f35aecafbfc6a68e8f9835d38d96dcdb25bb","observation_id":"a7d720ca-b63c-439a-8d53-88cc3e268380","resolution":{"observed_at":"2026-08-07T14:18:55.721329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T14:18:55.907967Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:55.907967Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:bf7eb5b1642ba560ce186ab6dd9a510a07105770de4c5274d477577f225fb8ce","observation_id":"3ce10ca2-5e5e-45ba-a977-153754d25f46","resolution":{"observed_at":"2026-08-07T14:18:55.907967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:56.052079Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:56.052079Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:d031082a9d306165b06352a6b1ece85cc63b4a96ca73f836f321a85be6d294b2","observation_id":"c7b92e2a-86c0-4a27-aff9-bb5b3b3c847b","resolution":{"observed_at":"2026-08-07T14:18:56.052079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-13T12:11:58.325060Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T14:18:56.238340Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:56.238340Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:67787c3e80524b3517ceed84c5424258c0b840885c4b938709b9203b2a55c4ce","observation_id":"4d710822-ad3f-410b-b1ee-8813fcc589ec","resolution":{"observed_at":"2026-08-07T14:18:56.238340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:00.136787Z","title":"Movq: Modulating quantized vectors for high-fidelity image generation","venue":null,"work_id":"c80e8dc9-65b7-45de-8dfd-b22ca13ec96d","year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:56.342837Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:5fb66e1c167e6f0df25643ae5552ae7e3d9838356115205093eb73a2c1dd37b8","observation_id":"2d1b0731-6331-444c-bf65-888d1f32a6d2","resolution":{"observed_at":"2026-08-07T14:19:00.276993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:56.481060Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:56.481060Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:2a69760f3bd7570d700b830aa65b8b85ba0fe10c52bf52e6b918529d417b1f3d","observation_id":"1ad97a92-c8cf-40fb-97b2-e858d76d3741","resolution":{"observed_at":"2026-08-07T14:18:56.481060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T14:18:56.599570Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:56.599570Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:9b765477593b4f659a740aa108917f9fd3e8f7d480b328f17c9da09e93a5d31d","observation_id":"2fbe24c8-87c0-4efc-84f2-4d69eb3d4cce","resolution":{"observed_at":"2026-08-07T14:18:56.599570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T14:18:56.761381Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:56.761381Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:8e23e4194dce19ae71fe0be29b7a05596732c6f214ee871eaf2a93f2d219f357","observation_id":"7f7fb99c-e21f-425a-8010-925854e1df01","resolution":{"observed_at":"2026-08-07T14:18:56.761381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:56.940918Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:56.940918Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:987905fe4e08f5395afe5fb170b286b3f11a95213ab887978b0d3c37f067ea57","observation_id":"42735c2f-3bc0-46f5-a769-d5050f6abdcc","resolution":{"observed_at":"2026-08-07T14:18:56.940918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T14:18:57.057555Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:57.057555Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:3b04e6c793dff80cd11bff2908e7ab333ba0d2395c58be3c8b5ad53e034cb72f","observation_id":"e693b3d5-37b3-47b8-8e2c-1867145ed260","resolution":{"observed_at":"2026-08-07T14:18:57.057555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:57.179181Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:57.179181Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:a0786592891f3789a386960c60c9ab18ca27958ccf41c7063349b9cb20ef9184","observation_id":"406fd3ad-69bb-4710-a8f4-8fdf63e9dfd7","resolution":{"observed_at":"2026-08-07T14:18:57.179181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:18:57.313128Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:57.313128Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:c342ab51368f264ce6bafed68b06567934bc596a2183726150b8dc5a88d091ec","observation_id":"3e7691ad-1c85-4d6a-8646-b65250830ad9","resolution":{"observed_at":"2026-08-07T14:18:57.313128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:57.445520Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:57.445520Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:bff04b130103956730661868e7efd6abf5d78159b6ddfa1c92890259c88fbf42","observation_id":"cef5d445-2c91-408e-ae4f-e378343b352d","resolution":{"observed_at":"2026-08-07T14:18:57.445520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:59.742503Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"bd40359c-37d3-4010-b4fb-5e2c45d37085","year":2018},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:57.626054Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:9d3b002ac11f6831d654ec4f462bc2538c3da43759fdff3a5d65a4357d570e8d","observation_id":"1a297325-00bb-422e-8fae-146270f85ee3","resolution":{"observed_at":"2026-08-07T14:18:59.900587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:57.760883Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:57.760883Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:b45a35785cfa114ed5b43870e8dd7130ffaa1bcedd158ebc9175daad39cee961","observation_id":"d58f2223-4fbb-4e7b-acb1-1aaae450cb00","resolution":{"observed_at":"2026-08-07T14:18:57.760883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:59.509539Z","title":"Semantic understanding of scenes through the ade20k dataset","venue":null,"work_id":"6d6986dc-4c10-4ae0-a7d1-46fb4b6293bc","year":2019},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:57.908944Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:c9e2fb066e53f079c1f9421116ff29a2417a6b3aa2b25831b55ea5027efce68c","observation_id":"261e5e7f-f591-42d2-83f9-619e9b9e5222","resolution":{"observed_at":"2026-08-07T14:18:59.614370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:58.044273Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:58.044273Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:6f54451462e3f97cef08fc8fdb1ccb144decf49ff1a65323c757df061b0b49ac","observation_id":"82e65a7f-dd6f-4645-a904-782ba0bbac15","resolution":{"observed_at":"2026-08-07T14:18:58.044273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:58.186762Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:58.186762Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:7f5c0b9ad05829881730871e8be04fcba93a92d0d299685899fc0d2a4a03fcf4","observation_id":"fd832eb5-db42-4116-a646-8ef24c2443b7","resolution":{"observed_at":"2026-08-07T14:18:58.186762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T14:18:58.338436Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:58.338436Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:a1d6755273ace6e34705eb4b45811be7e5fcc8ba8f3b30bb4cc4c0a9114496dd","observation_id":"4a8d71f9-e49c-49d5-955e-67827cfabefc","resolution":{"observed_at":"2026-08-07T14:18:58.338436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:58.515428Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:58.515428Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:3327a33e7f8c799b6665e6e7e06c9eaf017b4fdd2f80da86625c12859de6125c","observation_id":"739b10e3-3117-4911-8823-74b581b8c97c","resolution":{"observed_at":"2026-08-07T14:18:58.515428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08506","last_updated":"2024-04-12T14:40:45Z","snapshot_observed_at":"2026-08-13T00:31:54.264749Z","submitted_at":"2024-04-12T14:40:45Z","title":"LaSagnA: Language-based Segmentation Assistant for Complex Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08506","snapshot_observed_at":"2026-08-07T14:18:58.666978Z","title":"Language-based segmentation assistant for complex queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:58.666978Z"},"links":{"cited_paper":"/paper/2404.08506","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:e25bd085c232b4b192be1afefaf37a019aa76c2c2abc2f35ce5c8ef7af3c112e","observation_id":"f0aab330-2e8b-4741-83d6-0fadab5e9d1f","resolution":{"observed_at":"2026-08-07T14:18:58.666978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:59.209608Z","title":"Lavt: Language-aware vision transformer for referring image segmentation","venue":null,"work_id":"09868256-bfb5-4319-aab4-2697bc3fd9a3","year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:58.783069Z"},"links":{"citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:99fe5743f0a3e2b76a583f00d103ad2f0aea70cc432725d79ecfa06fa96ba3d1","observation_id":"e9dca6ff-306a-454e-a55a-ec518aafaed8","resolution":{"observed_at":"2026-08-07T14:18:59.328307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T09:22:30.446987Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 3 inbound Pith citation observations for arXiv:2505.19422."}