{"as_of":"2026-08-14T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6e1b915973ac0bf697a85445dd8d6b918ddde1603292029180481c0e6f6181a","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:09:57.563270Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22627/citation-record","integrity":"/paper/2505.22627/integrity","json":"/paper/2505.22627/citation-record.json","paper":"/paper/2505.22627"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-12T23:28:39.773027Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-07T13:09:52.757076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:52.757076Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:2df032d7fe469b3da387fad31a5af0f82d5ca72ee91ae55fb59f520a04241ee6","observation_id":"db4840ac-d4df-4a80-9360-edf369c6070e","resolution":{"observed_at":"2026-08-07T13:09:52.757076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09754","last_updated":"2025-04-03T14:52:24Z","snapshot_observed_at":"2026-08-13T20:42:34.474863Z","submitted_at":"2024-12-12T23:10:54Z","title":"ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09754","snapshot_observed_at":"2026-08-07T13:09:52.818163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:52.818163Z"},"links":{"cited_paper":"/paper/2412.09754","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:205d54a7bc7174dfd9b0b1f96bb03ddc8ae2361fc8f5c2aea3e40539ae46e4be","observation_id":"97e4b629-3eb7-46e6-8365-936fd6bbc686","resolution":{"observed_at":"2026-08-07T13:09:52.818163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:02.658111Z","title":null,"venue":null,"work_id":"d811e820-8067-4dd3-afbc-45d1ffed1a19","year":2025},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:52.944425Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:b40aeb11afc57d91b43d1890c9325b2ba5cc94ad7698aafe4e74f06134a212c6","observation_id":"e9165a33-7006-40ca-a21b-2993fc6c247c","resolution":{"observed_at":"2026-08-07T13:10:02.855876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:02.364225Z","title":null,"venue":null,"work_id":"40a9f003-d5cd-417f-80b1-be2882efbe78","year":2019},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:53.144290Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:b127521d6948d2979e8596dc718095f3383ce9a60dfcd8d3757abedf22fc66ea","observation_id":"5e55dc10-fec7-44d4-b425-c6ba8f86bc6d","resolution":{"observed_at":"2026-08-07T13:10:02.509109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:02.052225Z","title":null,"venue":null,"work_id":"5e20bde3-9057-4fd7-ba1f-8b2454a2f37a","year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:53.278925Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:158b2c3997095932b56805f9a2f74ff0e31463ed527d222bdc2ea4d4223df514","observation_id":"294c1e09-1a70-44de-a8aa-74f1604c70ff","resolution":{"observed_at":"2026-08-07T13:10:02.239948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:01.795607Z","title":null,"venue":null,"work_id":"9a6f9aa5-9c43-4546-87bb-47467132c979","year":2023},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:53.384267Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:7b5da95bab78b0a49099a24f18e3a7b2f7af0eba38218f34cd786ba5a36b7ca4","observation_id":"c45a80dd-5fcd-41b1-809d-994b4910fbe8","resolution":{"observed_at":"2026-08-07T13:10:01.914402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T13:09:53.467380Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:53.467380Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:7e09a76b5111f03b392ff33f87ca8ff6697888661024758d7fefb307dbb40cd2","observation_id":"e5361a22-6d2b-4a9f-ae62-405c7108ffd6","resolution":{"observed_at":"2026-08-07T13:09:53.467380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:01.586219Z","title":null,"venue":null,"work_id":"5582bfd0-58f0-4baf-852c-ac46370ff5f5","year":2025},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:53.565570Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:8db40440323c5011cd9539e60a15660f33909cf87bbfccbbf0fce48088abc0f8","observation_id":"7f564ca4-6239-4fff-a60b-700fc1d57c29","resolution":{"observed_at":"2026-08-07T13:10:01.691535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:01.194480Z","title":null,"venue":null,"work_id":"ef72035b-5da2-4975-b91d-dc077933e054","year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:53.733098Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:a7e7cd57a1af8f078da5a2ab7494633416d1a807a4b9b8ee45168b75f33defaa","observation_id":"8fb090b0-55be-43d3-81e2-cbf6b6fc61b4","resolution":{"observed_at":"2026-08-07T13:10:01.464413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:00.813823Z","title":null,"venue":null,"work_id":"baa7dc1f-0f7e-4221-9fd1-2b8862a1d808","year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:53.885125Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:a75034280ce2b7b1ee30323aa0734dda6e81cbb82c20725d2f892db8d14d9302","observation_id":"c90c1a2d-35b9-47ea-82fe-1f63f5f1a413","resolution":{"observed_at":"2026-08-07T13:10:01.007856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:00.437656Z","title":null,"venue":null,"work_id":"fbc0db80-f61e-4430-856a-606ea5081357","year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:54.030836Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:02e258e5cbf424037e55199c3a9c1b243c46b4d3003996388c004a9f7d2c0738","observation_id":"8b674199-294c-4990-b51c-573c57143605","resolution":{"observed_at":"2026-08-07T13:10:00.614688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0019-9958(64)90326-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Grignetti","venue":"Information and Control","work_id":"6356ffa2-5f73-4d7f-9bc5-8d0bfdac6db5","year":1964},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:54.187477Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:bf6fb1ec71a1f84e554e9076f642787f002292c547f7db403dfd25efcb35b256","observation_id":"8a139a40-81c4-4ad0-b1d6-3cf9b8b275a5","resolution":{"observed_at":"2026-08-07T13:09:57.909706Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T13:09:54.348201Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:54.348201Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:978ef1e814696ab3e726b4f310288ced1bb3e11aad1879df1544b70787c4d2a1","observation_id":"5d9c37af-94c3-40a3-9450-7fe2478b83fd","resolution":{"observed_at":"2026-08-07T13:09:54.348201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15270","last_updated":"2025-05-19T15:28:21Z","snapshot_observed_at":"2026-08-14T02:04:16.905562Z","submitted_at":"2024-10-20T03:59:54Z","title":"FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15270","snapshot_observed_at":"2026-08-07T13:09:54.477202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:54.477202Z"},"links":{"cited_paper":"/paper/2410.15270","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:4788bbebd2239e9a76333848fb8cadbc1800dc0d21cd8a81822b841e45da85fc","observation_id":"1ec0e489-5c86-4700-a630-1850abaa7d0f","resolution":{"observed_at":"2026-08-07T13:09:54.477202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-13T10:45:48.484753Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-07T13:09:54.615881Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:54.615881Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:ed8df319dae654424e08fd8bbe496b10c55142cf0e9888a1e566598b29a710d6","observation_id":"4ea8d0c7-8626-4ed6-97ff-c88b562bda53","resolution":{"observed_at":"2026-08-07T13:09:54.615881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15411","last_updated":"2024-11-23T02:20:32Z","snapshot_observed_at":"2026-08-14T05:18:19.543551Z","submitted_at":"2024-11-23T02:20:32Z","title":"FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity","version":1},"cited_work":{"arxiv_id":"2411.15411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15411","snapshot_observed_at":"2026-08-07T13:09:58.450358Z","title":"FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity","venue":"cs.CV","work_id":"8a6a4c33-9760-4883-85a0-4d207f37e990","year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:54.720587Z"},"links":{"cited_paper":"/paper/2411.15411","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:424731bfe18880a1c10c2c476942919428dcad94fbafec4d690b28c3c2e7032f","observation_id":"b5dd3067-6217-457f-afee-8abeab642646","resolution":{"observed_at":"2026-08-07T13:09:58.535733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:00.116082Z","title":null,"venue":null,"work_id":"091f8ac9-9845-4f89-bc92-487883cc04b9","year":2023},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:54.855117Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:ec9f2cba831fbdd4b311d0fc2f5dc5c2ce0a0504b6a7ec244eb6efc6013d6358","observation_id":"9e83ccb6-a7d0-458f-a039-26a84fa137d3","resolution":{"observed_at":"2026-08-07T13:10:00.245727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09301","last_updated":"2024-11-14T09:23:40Z","snapshot_observed_at":"2026-08-14T02:26:18.412741Z","submitted_at":"2024-11-14T09:23:40Z","title":"LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09301","snapshot_observed_at":"2026-08-07T13:09:55.054280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:55.054280Z"},"links":{"cited_paper":"/paper/2411.09301","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:4fd79e954c49fa6e4be0bf92b13b54fc276bf73b53582d8c638ed98765c67104","observation_id":"67223df3-9754-443b-b0e3-7ec53a4cce9b","resolution":{"observed_at":"2026-08-07T13:09:55.054280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:59.910027Z","title":null,"venue":null,"work_id":"c4c4388e-ab97-406c-b9ae-4e368d5bf0eb","year":2017},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:55.225085Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:edbde928e5e1691b5382bd2c478cc424169c9801c9769f640740750f7a542ae8","observation_id":"8d7d38e8-3cbb-4df8-af98-df39a8366de6","resolution":{"observed_at":"2026-08-07T13:10:00.014721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13013","last_updated":"2024-04-19T17:22:51Z","snapshot_observed_at":"2026-08-13T00:25:53.590712Z","submitted_at":"2024-04-19T17:22:51Z","title":"Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13013","snapshot_observed_at":"2026-08-07T13:09:55.361772Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:55.361772Z"},"links":{"cited_paper":"/paper/2404.13013","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:776a142a84be4fcc00f551db23fab897ca8be3ff7a907ac08187144f4306e241","observation_id":"5e0d2798-950b-4a36-8727-641072e1a430","resolution":{"observed_at":"2026-08-07T13:09:55.361772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10350","last_updated":"2023-10-26T03:41:06Z","snapshot_observed_at":"2026-08-13T10:52:25.504342Z","submitted_at":"2023-07-19T17:47:12Z","title":"Improving Multimodal Datasets with Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10350","snapshot_observed_at":"2026-08-07T13:09:55.512739Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:55.512739Z"},"links":{"cited_paper":"/paper/2307.10350","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:eeaf97ce20922e06206edef2b1648932fcbb8e0c9f9c8d7b3d81d4caae253ea4","observation_id":"746f77a6-0a68-42e1-a895-63cc1e808e60","resolution":{"observed_at":"2026-08-07T13:09:55.512739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19753","last_updated":"2024-04-30T17:56:24Z","snapshot_observed_at":"2026-08-13T11:37:24.849967Z","submitted_at":"2024-04-30T17:56:24Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19753","snapshot_observed_at":"2026-08-07T13:09:55.647399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:55.647399Z"},"links":{"cited_paper":"/paper/2404.19753","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:61a631d78415d7b82c23b21ecb5839b6785c2da9dc1f30d33aad26a9ff922bf6","observation_id":"2a229a72-0d73-45f5-876a-07f8928da016","resolution":{"observed_at":"2026-08-07T13:09:55.647399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-08-07T13:09:55.854741Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:55.854741Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:937f489e956b3fed6a48c015485e7b039a9346598cd538557ee3fb323eb8d354","observation_id":"af11f5c5-d302-4dc7-a9f3-23d3a0e51e42","resolution":{"observed_at":"2026-08-07T13:09:55.854741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.75463","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:58.137908Z","title":null,"venue":null,"work_id":"c2e812c9-a588-4016-9d18-0a70556d000b","year":2016},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.008221Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:eaf0817b1b005a63c73cc7e530e08a7255efc0f12f678e045739782517db56f4","observation_id":"fc42d7c7-346d-4616-82ed-346ebea65ab6","resolution":{"observed_at":"2026-08-07T13:09:58.254451Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:56.139372Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.139372Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:a215e15f1026b2fbd85684f0bc3bcbeb8194a031b78eabf534a6bac0eeefc133","observation_id":"b64bbed4-834a-400a-a9ec-46eeddedddc8","resolution":{"observed_at":"2026-08-07T13:09:56.139372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:59.659088Z","title":null,"venue":null,"work_id":"8d0c2cd3-9afd-4ab9-b29a-ce89022b0e63","year":2022},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.229648Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:072047e623e5fd19b94dbae4cffa651661e2d0d66db12c2e9029aef117850490","observation_id":"ae3e95de-5c85-46d1-95ad-5458b48c5e49","resolution":{"observed_at":"2026-08-07T13:09:59.766832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:56.376558Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.376558Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:55b3ac41307d32205601bfec6fe229dac672641d74a7c26a78a64c7105bf306e","observation_id":"3736107b-6ebb-480c-a423-a90e243e1f81","resolution":{"observed_at":"2026-08-07T13:09:56.376558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:59.497360Z","title":"Wobbrock, Kenny Liou, Andrew Ng, and James Landay","venue":null,"work_id":"dbbeb28d-0f09-44de-b958-95ca67d08d51","year":2016},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.555797Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:3f58e3b0fc7b9781d33773aaad8a5a60e0a9b0b5ddc87548d0ef537c7eedd6b4","observation_id":"71f60c78-f1bd-4e6b-b158-01b0ed7e9a87","resolution":{"observed_at":"2026-08-07T13:09:59.557122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13925","last_updated":"2025-01-23T18:59:30Z","snapshot_observed_at":"2026-08-10T21:53:41.825866Z","submitted_at":"2025-01-23T18:59:30Z","title":"GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13925","snapshot_observed_at":"2026-08-07T13:09:56.728661Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.728661Z"},"links":{"cited_paper":"/paper/2501.13925","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:05813a09eec09c4fb297d84d559f035282dfed6f2f455032f6364dbf258c1504","observation_id":"f64f7796-fdf6-48cf-abc3-728656b2098c","resolution":{"observed_at":"2026-08-07T13:09:56.728661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-08-12T23:42:27.541448Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-07T13:09:56.862819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.862819Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:e52817442e7390cc0e19c8422f608078e78b34add5697a63fe21b7ca45b9561d","observation_id":"8f4a2872-484e-4da9-85af-e0d56c56e405","resolution":{"observed_at":"2026-08-07T13:09:56.862819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:59.354362Z","title":null,"venue":null,"work_id":"270b18aa-3435-43d6-be07-92646446962a","year":2021},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.996995Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:5bb7f6bb5317c015c56da4ecea5bb46766b8ce08e67a5d96f106d5e6ec9c2ab8","observation_id":"2f2e8bdd-5db6-4499-91b8-1cd5ccd3827c","resolution":{"observed_at":"2026-08-07T13:09:59.441744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:59.104310Z","title":null,"venue":null,"work_id":"2ed0ee39-9de8-4b21-9e5f-2b30d8af986b","year":2015},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:57.107507Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:6a37c0da480b2711c0c5b2b1b7c85c33f378dccb431cbdf702d30e34180f8625","observation_id":"61093f1f-7136-4b60-848b-25e774f40996","resolution":{"observed_at":"2026-08-07T13:09:59.180572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:58.897978Z","title":null,"venue":null,"work_id":"bfc0a9dd-0cc5-4534-90d9-7d3328bd0a1d","year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:57.301352Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:f2db935c26f24adf17028e1c6262cb2edb55bb92263696f2692373c402385f47","observation_id":"bbf75e13-d033-40b7-bdb9-46981705fc0e","resolution":{"observed_at":"2026-08-07T13:09:58.973364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:57.434166Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:57.434166Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:e557a175f13524c0b13e156a0b286c5165d97af046f77830a307a2ecb79c295e","observation_id":"8f35ec5a-8402-4b1d-aa55-51f17c26e017","resolution":{"observed_at":"2026-08-07T13:09:57.434166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:57.563270Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:57.563270Z"},"links":{"citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:418f6d115e87adc793ecfce44ff121f0e8aa3863c4f66acdbf82a1aaa1e4dde8","observation_id":"5412e347-c575-4fbb-8019-8e836dc7bcd7","resolution":{"observed_at":"2026-08-07T13:09:57.563270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2505.22627."}