{"as_of":"2026-08-23T01:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e521ba281941d4c3054e6a9c11a736c674beaf5add9db03b12530d8a87171762","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:05:22.416317Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T07:09:25.049534Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:06:44.335867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"cited_work":{"arxiv_id":"2506.03643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03643","snapshot_observed_at":"2026-07-02T07:06:44.335867Z","title":"Images are worth variable length of representations","venue":null,"work_id":"b412ac37-71f0-4023-9595-9e6dcb1eb853","year":2025},"citing_paper":{"arxiv_id":"2603.06351","last_updated":"2026-05-07T16:40:07Z","snapshot_observed_at":"2026-08-11T15:47:08.117539Z","submitted_at":"2026-03-06T14:59:11Z","title":"DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T15:10:00.146694Z"},"links":{"cited_paper":"/paper/2506.03643","citing_paper":"/paper/2603.06351"},"observation_digest":"sha256:e8cb569c10e69c59688ec4388715556e1eaa458c37d128f65a1ea29dc4f6b46a","observation_id":"acf9eb43-b6b6-45a5-8c17-8e97430f7680","resolution":{"observed_at":"2026-05-15T15:10:05.814629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"cited_work":{"arxiv_id":"2506.03643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03643","snapshot_observed_at":"2026-07-02T07:06:44.335867Z","title":"Images are worth variable length of representations","venue":null,"work_id":"b412ac37-71f0-4023-9595-9e6dcb1eb853","year":2025},"citing_paper":{"arxiv_id":"2606.04461","last_updated":"2026-06-03T05:10:51Z","snapshot_observed_at":"2026-08-15T16:27:36.136478Z","submitted_at":"2026-06-03T05:10:51Z","title":"ChannelTok: Efficient Flexible-Length Vision Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T07:09:25.049534Z"},"links":{"cited_paper":"/paper/2506.03643","citing_paper":"/paper/2606.04461"},"observation_digest":"sha256:0d55a7034e6efa634be7141597be65bb425e217784970b298da41323c9c3918d","observation_id":"2b64c07e-428e-4fbb-9902-0b96192c6b33","resolution":{"observed_at":"2026-07-02T07:06:44.338154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03643/citation-record","integrity":"/paper/2506.03643/integrity","json":"/paper/2506.03643/citation-record.json","paper":"/paper/2506.03643"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:05:22.235943Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.235943Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:f290e40b6a9c5b3d9135b0a2f60696b1e3933d35a1fb249766a6226cc9b802c1","observation_id":"5fa297b5-09a8-47db-b861-d400370d9dc8","resolution":{"observed_at":"2026-08-07T11:05:22.235943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.239610Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.239610Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:ee020c9f2430569da639885e5e713db00c533589bc87e2e4c35db0451d7f0189","observation_id":"45912b42-4cdf-44e2-9917-854b7273e822","resolution":{"observed_at":"2026-08-07T11:05:22.239610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.242682Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.242682Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:c645065f56d7f574755fc3912d6cdba9b574c81506b9ad8323669c6aca815de2","observation_id":"d03f0524-d703-4c29-84d8-f74e3ed3d7c6","resolution":{"observed_at":"2026-08-07T11:05:22.242682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.931252Z","title":"Revisiting active perception.Autonomous Robots, 42:177–196, 2018","venue":null,"work_id":"a5be93d3-6744-409e-885d-bb6ac1c17116","year":2018},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.245814Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:0d9f94bc5214e22600d5f20270f3902946898175df2ee1d2460cd8ecd466701d","observation_id":"a2f8e363-b706-42b5-8f02-f5da44c53879","resolution":{"observed_at":"2026-08-07T11:05:22.934151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.921825Z","title":"Blur image detection using laplacian operator and open-cv","venue":null,"work_id":"a97f9ba0-9828-476b-ac53-f6d44a703d84","year":2016},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.248818Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:4c1be461f1674359d38ec97226901e2db858fc04ba0ef8e3689bf4faf612e8fc","observation_id":"fd3a7952-9f8a-4c5d-a704-96bcde14e1db","resolution":{"observed_at":"2026-08-07T11:05:22.924943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.910824Z","title":"Statistical inference for probabilistic functions of finite state markov chains.The annals of mathematical statistics, 37(6):1554–1563, 1966","venue":null,"work_id":"b0124ea0-faf3-4677-b398-a16d4db53ea8","year":1966},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.251721Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:7edb8c44185971095b476d891ca24aaecc0f65ec16ba6a95e7c1029c9fc50a4a","observation_id":"f132ad6e-5e22-4f43-a69a-77c5872919e6","resolution":{"observed_at":"2026-08-07T11:05:22.914977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.900404Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"31199b02-7f12-48da-bd1f-5da04c4ddc65","year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.255187Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:2850c478a2acfe2a017f4bfec76303154ad93bd42a8266f755124c8ef9ed1de4","observation_id":"891de3fe-d2f9-477f-8142-191130b5ae5e","resolution":{"observed_at":"2026-08-07T11:05:22.904132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.257886Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.257886Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:d480d5811d9a29471e29b74e80dfb5db20dcdaf6f13fa2be05682947202427e3","observation_id":"01c49392-716c-4588-a8b7-6ca5ececbaaf","resolution":{"observed_at":"2026-08-07T11:05:22.257886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.260665Z","title":"Food-101 – mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.260665Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:caa56386d504060fd520ef17bb53de271f1518969cac45efb4f0bbbcffc2a7ed","observation_id":"ad4bbdee-535d-4a74-9173-da359f52b388","resolution":{"observed_at":"2026-08-07T11:05:22.260665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.263449Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.263449Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:0c10653868ec6c4149d2b7515b545e01025633594d729cd34c2daedef1e2a849","observation_id":"2172ddcb-58ec-4afc-ac8b-c87d2e38167b","resolution":{"observed_at":"2026-08-07T11:05:22.263449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.869988Z","title":"Efficient large multi-modal models via visual context compression","venue":null,"work_id":"e3ac39dd-ae53-4a2e-815f-c639760050d1","year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.266244Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:ffc862597a108554e195d864e8573cb44803ef46ad477baf8a5aca0eef060a62","observation_id":"e44a12e4-71b8-4b62-b426-1cd75b084c70","resolution":{"observed_at":"2026-08-07T11:05:22.873209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.859781Z","title":"Review of image classification algorithms based on convolutional neural networks.Remote Sensing, 13(22):4712, 2021","venue":null,"work_id":"dc8a8528-98b1-470a-aeba-9f01b50249a2","year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.269137Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:1b90fb38f652c4c7775f454de011f64708c2c4eb24ad06798feead102e02893d","observation_id":"01fa2fea-701b-42d8-a567-8bd7311bcea3","resolution":{"observed_at":"2026-08-07T11:05:22.862922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.849565Z","title":"An empirical study of smoothing techniques for language modeling","venue":null,"work_id":"9a688861-4f0b-4aea-aec5-bf82c12c18fb","year":1999},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.271750Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:aec497704626d5dc524da1fdceefd9840753e402ef0cf8707188a73f44d36084","observation_id":"ca84c8ff-6e6b-486e-b2f8-78b8f3a4b496","resolution":{"observed_at":"2026-08-07T11:05:22.852630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.274496Z","title":"Cimpoi, S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.274496Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:beff44fc4f93775ccdc50f0f0791ac3d471cdcaf3426cf234853d705e12d2304","observation_id":"8d482209-8cb5-4eab-a1d2-0e307aee191e","resolution":{"observed_at":"2026-08-07T11:05:22.274496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.833777Z","title":"An analysis of single layer networks in unsupervised feature learning aistats","venue":null,"work_id":"d594c131-afec-40b4-bf3c-be7eca1c0c93","year":2011},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.277525Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:31c501c661392fdd0b8c1a0bbfad1239c7c62f11787a308bbf4487aa0d1c7df0","observation_id":"6e7ac09b-2df3-4c41-b5d0-2c3d7ccca8a1","resolution":{"observed_at":"2026-08-07T11:05:22.836894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.280475Z","title":"Scaling up dataset distillation to imagenet-1k with constant memory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.280475Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:f89dcb1434a433fd4971f872bc31f3c7dee3f438c9a380218c16aeda4d081f31","observation_id":"c9be1d94-02f7-47eb-b6b9-6470a20c06c5","resolution":{"observed_at":"2026-08-07T11:05:22.280475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.816141Z","title":"Top-down control of eye movements: Yarbus revisited.Visual Cognition, 17(6-7):790–811, 2009","venue":null,"work_id":"95cee089-ead6-40b4-83ec-b3c3e05fc300","year":2009},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.283436Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:b78aaa2cca81146539fb071f06a8d007f2474d01b18bd72a5994e4adfe5e4ea9","observation_id":"9e6443a4-945f-40b8-b154-11e647a0239c","resolution":{"observed_at":"2026-08-07T11:05:22.820288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.805875Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"6001f945-9318-4da9-a2f8-809bb82891f0","year":2009},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.286379Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:e27a2be8535e5b44595da5cf7e38e59033cb96458e28eca1790b2eeef00ef83a","observation_id":"c76268b8-cb52-4d1e-a89b-0b55abb2c568","resolution":{"observed_at":"2026-08-07T11:05:22.809368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.289289Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.289289Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:7a8ea38e8ebe8147666ab1e16ac2e12ecc6948018276530bd6990ffc606cd51b","observation_id":"ff348b87-899f-4bd0-9660-cbc8c5a06b90","resolution":{"observed_at":"2026-08-07T11:05:22.289289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.788660Z","title":"Adaptive length image tok- enization via recurrent allocation","venue":null,"work_id":"fbeddfb7-b0ea-4c7c-b523-05ddc65cfde4","year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.292319Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:0863b51ab01ce626ae3a0a8e1ca18ce163589d0b50c6a332748e5b9ff1426210","observation_id":"92471137-7e22-4321-8b0b-a8cba96c9d0f","resolution":{"observed_at":"2026-08-07T11:05:22.791905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.295367Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.295367Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:ae90fc921078cce8da6093a37cfa7873247692737e6331501843b69f01bbe598","observation_id":"6b25f19e-82c0-4e3e-90c4-99087b80d5c5","resolution":{"observed_at":"2026-08-07T11:05:22.295367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.772395Z","title":"Multimodal autoregressive pre-training of large vision encoders, 2024","venue":null,"work_id":"91f8834d-0869-432d-8aa5-3a89710f252d","year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.298398Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:f5bfc106cf763b6dc63b36d6ea2c5d4d6733969d66634965d7e3c9c31edf2da4","observation_id":"95c113f2-cfef-4850-8774-b2cb5ebb92f9","resolution":{"observed_at":"2026-08-07T11:05:22.775879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.301186Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.301186Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:23d77e9552343df753a17f991433ee4ebd76ce9a20dca912157d06e52775cf20","observation_id":"d7e007a9-dfd4-4daf-8305-60905aef446f","resolution":{"observed_at":"2026-08-07T11:05:22.301186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:05:22.304085Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.304085Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:48afb4d4c7911dd17ff6380973ccee3769f40ceab86cadf81f71bbe4f3ee114d","observation_id":"c6bd0c5f-092f-44b4-b79f-b4dcf9d75158","resolution":{"observed_at":"2026-08-07T11:05:22.304085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:05:22.307061Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.307061Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:2c29bda266a460288a31a0e95b1a40f6074e6d748c94a64d4fac6809d4681a3e","observation_id":"fe918958-fb65-46b5-ba89-513bb74ace0d","resolution":{"observed_at":"2026-08-07T11:05:22.307061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.755273Z","title":"A review of semantic segmentation using deep neural networks.International journal of multimedia information retrieval, 7:87–93, 2018","venue":null,"work_id":"1d203107-4cb4-4a5d-9605-0e5f2daedad3","year":2018},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.310089Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:7d619b3a5c41c0f1e1731be83680b044e3bdf63fa8f00ccefba06973f66f0188","observation_id":"43299d14-b086-4b06-b686-53aa23a0cc53","resolution":{"observed_at":"2026-08-07T11:05:22.758858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.312920Z","title":"A brief survey on semantic segmentation with deep learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.312920Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:d88455488d1d776b0bf86b1259880d10ba4b8af06dc55470b90fff14c0904e3e","observation_id":"019de7a3-6c95-41e8-9e30-3ea473633ec8","resolution":{"observed_at":"2026-08-07T11:05:22.312920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.738127Z","title":"Hierarchical cross-modal agent for robotics vision-and-language navigation","venue":null,"work_id":"1eae6284-1f51-467a-8dad-7bec8fddae85","year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.316327Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:3bcafa6688c9c6fd1c5bdf00006c22bc8e8660280fae0b0984535d0df519b795","observation_id":"48f972e5-dcc0-4816-9149-9f89f62bbbe1","resolution":{"observed_at":"2026-08-07T11:05:22.741335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-07T11:05:22.319209Z","title":"Perceiver io: A general architecture for structured inputs & outputs.arXiv preprint arXiv:2107.14795, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.319209Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:2685a50eaea4d9f61501cb278154eaa873d0d4cbac2ca015ab1270fc1eef0d65","observation_id":"6bece6e8-d26d-4f67-b9c6-82763fa8dad1","resolution":{"observed_at":"2026-08-07T11:05:22.319209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.322257Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.322257Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:9b17a8b86b6c5c141a7b8e065ea78900369d0f39bf12b895c53ea54ba05cb8de","observation_id":"f3001747-ebb7-4a85-b3d1-db8d77ccf7f0","resolution":{"observed_at":"2026-08-07T11:05:22.322257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.324996Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.324996Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:03d73b3333740d0aa79604cb25028f33e278b0ec42e874fda94814d1128bc986","observation_id":"9b001137-dc8a-4ab0-a6e0-3bccaf5394aa","resolution":{"observed_at":"2026-08-07T11:05:22.324996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.327905Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.327905Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:5707efb4b0647b9ebbcf331e994c00fe5bf20867f5c54ac95dc538d092ae5067","observation_id":"36a19078-aea1-4d25-ba63-b83344cfb3e3","resolution":{"observed_at":"2026-08-07T11:05:22.327905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.330945Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.330945Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:027c5229d608c23b038aa26cb1664b558f016db8cd5b85435cdc0e7c50dbde94","observation_id":"41ee6020-27b0-4d1c-8767-75c13e86566b","resolution":{"observed_at":"2026-08-07T11:05:22.330945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.334047Z","title":null,"venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.334047Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:e12afcc6dd6162c13b40216e46f7391e4e4ba416a66b822c9416ee7085bd089b","observation_id":"77620b32-7059-4b66-a838-71e014c302c0","resolution":{"observed_at":"2026-08-07T11:05:22.334047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.694378Z","title":"The roles of vision and eye movements in the control of activities of daily living.Perception, 28(11):1311–1328, 1999","venue":null,"work_id":"c582696c-8d83-431d-bcb0-5dec1b90846d","year":1999},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.336862Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:0a8500edf24b62bf25bf07b137573d80cc86100e8389ceca6192769a7a5ac27c","observation_id":"d9380372-0304-4957-9e22-d96bf19a583d","resolution":{"observed_at":"2026-08-07T11:05:22.698087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.340117Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.340117Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:2b09777a5499a460de52848d41f2a7881da6b70c07642cca31abeedbceb94e37","observation_id":"42c60635-8e1e-4e20-972e-3a8ba85d4ffe","resolution":{"observed_at":"2026-08-07T11:05:22.340117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.677973Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"219e891a-33b6-472f-b51f-ab304d6fbdf3","year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.342828Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:848199b973e9a769305208b983bd13c56f32faad2f8afededd3ef19ecbf8a390","observation_id":"f52a53eb-89ab-4977-b03b-1fc26cb8d4c5","resolution":{"observed_at":"2026-08-07T11:05:22.681102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.667308Z","title":"A survey of image classification methods and techniques for improving classification performance.International journal of Remote sensing, 28(5):823–870, 2007","venue":null,"work_id":"b8fef232-ad16-4822-99e8-e336c52e8a80","year":2007},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.345651Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:60496805ec24ecb1066db46a2acd089219f8c261d634929f1340538b8f0e0e87","observation_id":"96561ff4-5ad4-48de-8efe-babd7df27e49","resolution":{"observed_at":"2026-08-07T11:05:22.670826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.348474Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.348474Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:bfff94ee8273b2bb204642fe897d0944aba29c51856db11d95226fb53d188200","observation_id":"4e3f4811-8715-4b05-a7b0-9bbde605c2c1","resolution":{"observed_at":"2026-08-07T11:05:22.348474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.351532Z","title":"Fine-grained visual classification of aircraft, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.351532Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:65316387d96c868d02a00fabc6e60ab63ebb901e971b8b8f7a3be3027ba3c3b0","observation_id":"5692391d-aa2f-4c6c-a73f-199b11dd5a1a","resolution":{"observed_at":"2026-08-07T11:05:22.351532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.354914Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.354914Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:3f3393cb3aab029a6a60a787826961a60550293a00fe196bfd8173c4fca9d911","observation_id":"00df95de-f42a-4d2f-9812-6f9301f61c5f","resolution":{"observed_at":"2026-08-07T11:05:22.354914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.357727Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.357727Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:267d20e66d6d98d1c28a47036e67c1efc29b5aa519857c3940ed00a79648ac71","observation_id":"7da9feef-d2de-41b9-a215-da20f4d4b611","resolution":{"observed_at":"2026-08-07T11:05:22.357727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.360520Z","title":"V Jawahar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.360520Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:cc9e2d221616fecb80eb999f0fd12cd73db90f62dc142902f6f57beeeccd20ee","observation_id":"7b8df15e-85fb-43e6-bb6a-f7c9738b71e3","resolution":{"observed_at":"2026-08-07T11:05:22.360520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.363555Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.363555Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:4705298c70203cd9588b64d1e57502880c9516a6c7336df467c8a3492afe1a99","observation_id":"d92654c2-b6b8-4e24-9f1a-081cd8ab8de1","resolution":{"observed_at":"2026-08-07T11:05:22.363555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.616256Z","title":"Stl-10, nov 2024","venue":null,"work_id":"1bc87bc2-f8f7-4f25-ac32-0fd11441ac30","year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.366118Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:83e0c70d001e3216b0898d7c012c7f7d7005cad10179589053ca1ba8f65d6234","observation_id":"aaeaaffa-f164-4f98-8d82-5f7d2d7c1063","resolution":{"observed_at":"2026-08-07T11:05:22.619520Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.368954Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.368954Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:30fadc2d67ef5519103a38ae2b0efbdaf203c22a7a08f074e3f777a74201c6a9","observation_id":"2ae2af82-135c-4123-8a5c-2f48793d3f72","resolution":{"observed_at":"2026-08-07T11:05:22.368954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T11:05:22.371771Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.371771Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:eed8708d834352df6ed519426963ae03b1b957e6e71bf62e3fdc01307583dd95","observation_id":"82b92334-15b0-45d2-94c7-f836d7634716","resolution":{"observed_at":"2026-08-07T11:05:22.371771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.374870Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification.Advances in neural information processing systems, 34:13937–13949, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.374870Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:cc1781e81cc74df2e520f4925940ff5e9ba9ae92a364f738b29a84170a5b9e7a","observation_id":"10ca220c-212c-444f-8b32-e6b1ef1576ec","resolution":{"observed_at":"2026-08-07T11:05:22.374870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.377480Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.377480Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:b1d91652680fdc2308170fb6f886bac9e0615e57207812313f5fed43f7519229","observation_id":"3be09f3f-052c-41df-aa96-d8b96c5b0430","resolution":{"observed_at":"2026-08-07T11:05:22.377480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.381721Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.381721Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:eb4952e9be7a343042bcd0f1c327467722812596c897e90e52fb6296207c4aae","observation_id":"88a6ba60-4198-4c95-bf35-0f7e44931193","resolution":{"observed_at":"2026-08-07T11:05:22.381721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.384499Z","title":"Towards vqa models that can read, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.384499Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:136503e6d4d9ef7abf81b8a8d3c5481d5d1d4e2310e4a879a8b5b62798be2855","observation_id":"fe8720a3-f6eb-49ed-81c7-91b2fcbd33f4","resolution":{"observed_at":"2026-08-07T11:05:22.384499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.387502Z","title":"Between mdps and semi-mdps: A framework for temporal abstraction in reinforcement learning.Artificial intelligence, 112(1-2):181–211, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.387502Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:8060ef665863d664540bc644443363eeb4e9e5c8d338bbfff26996f42ae13589","observation_id":"05203ea4-08d8-4c28-9b26-bfc328771026","resolution":{"observed_at":"2026-08-07T11:05:22.387502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:05:22.390224Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.390224Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:76666fa50780dc8302d6e9eead5ea8a8111a4ed5784ec7d68cd0db2ddcc79b42","observation_id":"8866789d-7efd-46b3-91d9-5bbeb1ed0fcb","resolution":{"observed_at":"2026-08-07T11:05:22.390224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.393356Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.393356Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:d325424d2b0467131d59da7b526a3c413f7b2c97f050ebccfb66931a36be7034","observation_id":"6e42155a-daaf-4746-9f3f-11801312b986","resolution":{"observed_at":"2026-08-07T11:05:22.393356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.396119Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.396119Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:3cb706b7698a850f0b3106d179dc838969e7cc0cde4481bd8b4acbd7c599444a","observation_id":"d13295d0-1535-4bae-b745-3635609c0cdd","resolution":{"observed_at":"2026-08-07T11:05:22.396119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.555004Z","title":"Supervised hashing for image retrieval via image representation learning","venue":null,"work_id":"304fed39-cb41-45ce-a511-2a31a17f4a18","year":2014},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.398997Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:f68080401d0d1cffb0d8604837abc716df93323b7b70670185c5955183efe0ca","observation_id":"c6c02abb-3fb2-480d-8926-60765e2584e4","resolution":{"observed_at":"2026-08-07T11:05:22.558474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.545307Z","title":"Ehinger, Aude Oliva, and Antonio Torralba","venue":null,"work_id":"222d9e69-c4e5-4b27-a8f6-b54a0a229ceb","year":2010},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.401621Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:816525f68f17af07eea05809238e8641d3ae99b399a059e562708c741a33ae99","observation_id":"584a92dd-b964-41ec-8b3b-20017a04943d","resolution":{"observed_at":"2026-08-07T11:05:22.548329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.404732Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.404732Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:7a22d848dd727764308c4c52794650ad8f823e23ef20245c12f89bad62c514f6","observation_id":"bc20ad02-831e-4c8b-b824-d8e030d24534","resolution":{"observed_at":"2026-08-07T11:05:22.404732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-18T22:18:02.034966Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T11:05:22.407403Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.407403Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:697ba7b61b710d09284cfc36a744c8ce83adf8d1a4120e792c0be3c6f83547ed","observation_id":"b7f27687-3010-43f3-bdbe-4f0cc2ef0e23","resolution":{"observed_at":"2026-08-07T11:05:22.407403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.410713Z","title":"An image is worth 32 tokens for reconstruction and generation.Advances in Neural Information Processing Systems, 37:128940–128966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.410713Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:528b027443d793aedc4e4c7fc65c4cfb811263f14e6c77aaec87925b2fc343f0","observation_id":"2f1ff9be-878a-4111-aedb-0634abbdcec8","resolution":{"observed_at":"2026-08-07T11:05:22.410713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.521901Z","title":"Object detection with deep learning: A review.IEEE transactions on neural networks and learning systems, 30(11):3212–3232, 2019","venue":null,"work_id":"cadacca5-9aa5-4a24-8bf0-1fe08b49cc70","year":2019},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.413512Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:067a9200566c05b30ed1b1b312b94110b786558bcd3751fd24b4b319f3de8bf4","observation_id":"88729760-bbb3-4dce-b971-1b0cccb86c0b","resolution":{"observed_at":"2026-08-07T11:05:22.525814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.511107Z","title":"STOP” on a sign as “SHOP","venue":null,"work_id":"1628a2a2-ff05-4cd5-a09c-c8b2f8007739","year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.416317Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:1dccd8861fe6116a85896218ef3826afb174048439fa9563d6418143b3e24e4a","observation_id":"73c305e8-6a6d-4ba0-b741-f6e23dfe44ca","resolution":{"observed_at":"2026-08-07T11:05:22.514936Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T13:09:55.099595Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":40,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 2 inbound Pith citation observations for arXiv:2506.03643."}