{"as_of":"2026-08-10T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b2d1a7dbbdcc1faa64684afcf39592f26c4ad38151040f810ec0b2c13edaeaf","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:27:39.491216Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.14045/citation-record","integrity":"/paper/2508.14045/integrity","json":"/paper/2508.14045/citation-record.json","paper":"/paper/2508.14045"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.142990Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.142990Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:2fdd701d95685552f5a831a4acaab2a12607c07cd83973287fd8c565efc882a2","observation_id":"460933a4-410f-404f-a920-cb7a238ba56a","resolution":{"observed_at":"2026-08-06T10:27:39.142990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.147551Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.147551Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:174c67bd0efdd7cf67d9edadbf713dad4cdbb29beca21e925f99d1f312349f8e","observation_id":"68db7014-2d91-40f8-9766-8128851954a9","resolution":{"observed_at":"2026-08-06T10:27:39.147551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08822","last_updated":"2016-07-29T14:26:27Z","snapshot_observed_at":"2026-07-06T05:05:22.910483Z","submitted_at":"2016-07-29T14:26:27Z","title":"SPICE: Semantic Propositional Image Caption Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08822","snapshot_observed_at":"2026-08-06T10:27:39.151762Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.151762Z"},"links":{"cited_paper":"/paper/1607.08822","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:63e3f39d77ef968bcfc57b355f279845f3b72629c712b477eaf5c9241886cdf8","observation_id":"67917612-ccc8-49d8-a5d3-50d109e71a17","resolution":{"observed_at":"2026-08-06T10:27:39.151762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07998","last_updated":"2018-03-14T05:24:23Z","snapshot_observed_at":"2026-08-02T01:53:59.032840Z","submitted_at":"2017-07-25T13:50:17Z","title":"Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07998","snapshot_observed_at":"2026-08-06T10:27:39.156320Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.156320Z"},"links":{"cited_paper":"/paper/1707.07998","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:6ecdd451fbee8cfbcc7f8a954077dbf2052dd4a497b1fee037ece051edca0012","observation_id":"8922e562-aa55-4287-95b4-a4f6c09712ef","resolution":{"observed_at":"2026-08-06T10:27:39.156320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16890","last_updated":"2023-09-04T15:06:15Z","snapshot_observed_at":"2026-07-06T16:12:55.132006Z","submitted_at":"2023-08-31T17:52:04Z","title":"TouchStone: Evaluating Vision-Language Models by Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16890","snapshot_observed_at":"2026-08-06T10:27:39.160499Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.160499Z"},"links":{"cited_paper":"/paper/2308.16890","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:63b464d3c527020ee379fe53f2a7e32473824f9597c36c0b5266d1b81e09d856","observation_id":"8208d6aa-a0b3-4ca8-8279-123b8ef4fb3c","resolution":{"observed_at":"2026-08-06T10:27:39.160499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.164465Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.164465Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:7411169cc074597e6cf5bdc5c8a544ef6ecc9687e2c3b0d4f7061aabb39e4ecd","observation_id":"19d49c2c-5034-483f-885d-61a32c798eae","resolution":{"observed_at":"2026-08-06T10:27:39.164465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02963","last_updated":"2021-02-05T02:15:28Z","snapshot_observed_at":"2026-08-06T19:55:15.255631Z","submitted_at":"2021-02-05T02:15:28Z","title":"Commonsense Knowledge Aware Concept Selection For Diverse and Informative Visual Storytelling","version":1},"cited_work":{"arxiv_id":"2102.02963","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.02963","snapshot_observed_at":"2026-08-06T10:27:40.551832Z","title":"Commonsense Knowledge Aware Concept Selection For Diverse and Informative Visual Storytelling","venue":"cs.CV","work_id":"1f81d765-dd47-4542-8e6b-0f127fb3b40b","year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.168379Z"},"links":{"cited_paper":"/paper/2102.02963","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:781da3739df6760a1c3e2861f36e4190809575ac66b624649d8610f1c8245d53","observation_id":"1136e2c7-61fc-4591-b176-f46da3e3f86a","resolution":{"observed_at":"2026-08-06T10:27:40.555602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.172413Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.172413Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:976cc6160308144d585d1c64396f98dbcbd3a3328c3e96ff6d8166c88398798a","observation_id":"fc08cee6-7010-4466-8aef-9b7c28a56ec1","resolution":{"observed_at":"2026-08-06T10:27:39.172413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11550","last_updated":"2024-03-18T08:01:23Z","snapshot_observed_at":"2026-08-05T03:26:32.558627Z","submitted_at":"2024-03-18T08:01:23Z","title":"TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling","version":1},"cited_work":{"arxiv_id":"2403.11550","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.11550","snapshot_observed_at":"2026-08-06T10:27:40.453119Z","title":"TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling","venue":"cs.CV","work_id":"930f4443-a845-4f81-83ab-2eb87cdda50a","year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.176728Z"},"links":{"cited_paper":"/paper/2403.11550","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:e2c5ae814df03985162ff93ea7347b1825aac16d69dc8e1c39ac1d8e6258e209","observation_id":"ee8efa95-40e1-4047-9f60-72b97afb0630","resolution":{"observed_at":"2026-08-06T10:27:40.457057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.180421Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.180421Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:c2b42ad3b68d0e8e343f5b883d260e062a6575a63c5b90fcb8e029af9c02d338","observation_id":"1e2fad49-b672-4775-bce9-b8e9a9f4ad87","resolution":{"observed_at":"2026-08-06T10:27:39.180421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.183894Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.183894Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:6753a1e57de3d845a333ea1000c814b775d7e8b83d6410ab8d541c1c912c4b00","observation_id":"09d7a993-ac83-4163-a3f9-7861dc75b291","resolution":{"observed_at":"2026-08-06T10:27:39.183894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04467","last_updated":"2015-05-17T22:14:27Z","snapshot_observed_at":"2026-07-06T04:18:06.575803Z","submitted_at":"2015-05-17T22:14:27Z","title":"Exploring Nearest Neighbor Approaches for Image Captioning","version":1},"cited_work":{"arxiv_id":"1505.04467","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04467","snapshot_observed_at":"2026-08-06T10:27:40.438755Z","title":"Exploring Nearest Neighbor Approaches for Image Captioning","venue":"cs.CV","work_id":"7cd02b65-3a62-4e21-a92f-b6932f6fb5fb","year":2015},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.187962Z"},"links":{"cited_paper":"/paper/1505.04467","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:bf04f89beca8171b772d303a58a53eabb3cbe90ac1776e6182702160b35fd72b","observation_id":"6662c5ec-dd13-476d-8be4-0d40515305e6","resolution":{"observed_at":"2026-08-06T10:27:40.442624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T10:27:39.191648Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.191648Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:6433c11a681b0785fd97d577f930fb41cccedc6b1095abe0584b798b65166177","observation_id":"01b27af5-ae41-49e7-a259-165e2d91c103","resolution":{"observed_at":"2026-08-06T10:27:39.191648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9877.34906","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.412447Z","title":null,"venue":null,"work_id":"7bd7c3ee-92bb-42da-961c-de63f390fbc4","year":2022},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.195374Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:d240fd360f90ae646bac7433c2caf1b3f677244bcb139a8ae8b012f39e32b629","observation_id":"fbed2d2d-eadb-49c3-b8e3-090c433f12ad","resolution":{"observed_at":"2026-08-06T10:27:40.417408Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00828","last_updated":"2021-07-08T17:18:13Z","snapshot_observed_at":"2026-08-03T13:29:59.113145Z","submitted_at":"2021-01-04T08:31:11Z","title":"Transformer-based Conditional Variational Autoencoder for Controllable Story Generation","version":2},"cited_work":{"arxiv_id":"2101.00828","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.00828","snapshot_observed_at":"2026-08-06T10:27:40.338644Z","title":"Transformer-based Conditional Variational Autoencoder for Controllable Story Generation","venue":"cs.CL","work_id":"07f52b49-f150-48bc-8cb8-8c42ebfbcddb","year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.199030Z"},"links":{"cited_paper":"/paper/2101.00828","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:8ade09abdaceec5f8a9894086e52b0eabe4070fb2e8d4a2e4f065b1796f3601e","observation_id":"fb83ea58-8d96-44da-96d7-3690c62f155d","resolution":{"observed_at":"2026-08-06T10:27:40.343040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.202850Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.202850Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:ad3b35faa9006d905ad5a17b78afbf129ecc7607d9702c674635106847bcfa46","observation_id":"78cb959e-289a-4eec-927b-980ea2f91043","resolution":{"observed_at":"2026-08-06T10:27:39.202850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.206292Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.206292Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:4e17d8de536e407c83ab5c3d5081a907d2b264c95025ee90a23622646ce1f652","observation_id":"cfb859f3-90cd-4b9c-90a8-93cf080365af","resolution":{"observed_at":"2026-08-06T10:27:39.206292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00738","last_updated":"2018-06-03T05:09:54Z","snapshot_observed_at":"2026-07-06T06:42:40.404823Z","submitted_at":"2018-06-03T05:09:54Z","title":"Contextualize, Show and Tell: A Neural Visual Storyteller","version":1},"cited_work":{"arxiv_id":"1806.00738","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.00738","snapshot_observed_at":"2026-08-06T10:27:40.324484Z","title":"Contextualize, Show and Tell: A Neural Visual Storyteller","venue":"cs.CL","work_id":"3f63620e-c2c6-4bd6-9451-c9925f89bfd9","year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.209675Z"},"links":{"cited_paper":"/paper/1806.00738","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:73b2d150af59a4ffc15b2423280df7bf30f9a67653fcad81647b8346e55ed711","observation_id":"65897f70-5776-44ba-b7e1-953f6a2545d6","resolution":{"observed_at":"2026-08-06T10:27:40.328324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.05139","last_updated":"2020-01-15T05:42:27Z","snapshot_observed_at":"2026-07-06T08:50:34.361183Z","submitted_at":"2020-01-15T05:42:27Z","title":"A Knowledge-Enhanced Pretraining Model for Commonsense Story Generation","version":1},"cited_work":{"arxiv_id":"2001.05139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.05139","snapshot_observed_at":"2026-08-06T10:27:40.310777Z","title":"A Knowledge-Enhanced Pretraining Model for Commonsense Story Generation","venue":"cs.CL","work_id":"ce53ef97-39b0-43c7-9890-3c9d352068b4","year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.213265Z"},"links":{"cited_paper":"/paper/2001.05139","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:1e34f04b7109b421aedf374237d030ddc10317e8a395976da39a8c8983d092ca","observation_id":"5319b260-92f2-4cf1-85d6-529914bd1dbd","resolution":{"observed_at":"2026-08-06T10:27:40.314505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03182","last_updated":"2020-10-25T05:21:52Z","snapshot_observed_at":"2026-07-06T10:02:11.078138Z","submitted_at":"2020-10-07T05:25:30Z","title":"VICTR: Visual Information Captured Text Representation for Text-to-Image Multimodal Tasks","version":3},"cited_work":{"arxiv_id":"2010.03182","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.03182","snapshot_observed_at":"2026-08-06T10:27:40.296506Z","title":"VICTR: Visual Information Captured Text Representation for Text-to-Image Multimodal Tasks","venue":"cs.CV","work_id":"03b7ce32-d64c-4d21-80cd-3686b90762c9","year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.216713Z"},"links":{"cited_paper":"/paper/2010.03182","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:326478f3847bb1f19b1b822301dd9a5e77732691bebc58973daf757d48995ec2","observation_id":"6919e57d-be18-41dc-8699-d038eb3be25d","resolution":{"observed_at":"2026-08-06T10:27:40.300254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-06T10:27:39.220359Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.220359Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:f8a5c3224984be781b145999aaa6912160ccce281fe275fcdd0010d00a58ae05","observation_id":"77020388-c12f-4cc3-8929-a18ee2cd8ff7","resolution":{"observed_at":"2026-08-06T10:27:39.220359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.14231","last_updated":"2020-10-02T19:26:14Z","snapshot_observed_at":"2026-08-06T06:08:25.432925Z","submitted_at":"2020-04-29T14:30:57Z","title":"Image Captioning through Image Transformer","version":2},"cited_work":{"arxiv_id":"2004.14231","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.14231","snapshot_observed_at":"2026-08-06T10:27:40.272508Z","title":"Image Captioning through Image Transformer","venue":"cs.CV","work_id":"64dea836-3320-414e-b91c-a38df017ec5d","year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.223799Z"},"links":{"cited_paper":"/paper/2004.14231","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:5b42efac40f65c6c590aaa82e42e02426ade7e409b9cfe46d1930c247404280a","observation_id":"0578e642-1779-4e5f-9d47-9397ae743d20","resolution":{"observed_at":"2026-08-06T10:27:40.276721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05963","last_updated":"2020-01-11T11:03:05Z","snapshot_observed_at":"2026-07-06T08:00:13.822686Z","submitted_at":"2019-06-14T00:00:29Z","title":"Image Captioning: Transforming Objects into Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05963","snapshot_observed_at":"2026-08-06T10:27:39.227854Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.227854Z"},"links":{"cited_paper":"/paper/1906.05963","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:952ee7e663fe2a802a9605eb5cbbcd92e82288ef4bd465034066bda2661d33ef","observation_id":"2c6c43eb-392d-4435-bb10-1af549fdd19f","resolution":{"observed_at":"2026-08-06T10:27:39.227854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08571","last_updated":"2023-01-20T13:38:24Z","snapshot_observed_at":"2026-08-09T13:11:20.014373Z","submitted_at":"2023-01-20T13:38:24Z","title":"Visual Writing Prompts: Character-Grounded Story Generation with Curated Image Sequences","version":1},"cited_work":{"arxiv_id":"2301.08571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.08571","snapshot_observed_at":"2026-08-06T10:27:40.248589Z","title":"Visual Writing Prompts: Character-Grounded Story Generation with Curated Image Sequences","venue":"cs.CL","work_id":"deb2ec6c-cd9f-43d3-a264-ac38516d3308","year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.231546Z"},"links":{"cited_paper":"/paper/2301.08571","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:bef80c9ee0bc99b5afc8cbb2550af2f744df05c9227adab0d9a653015e2492d1","observation_id":"7efec995-1c58-4e65-a53d-5a0a5e6d3878","resolution":{"observed_at":"2026-08-06T10:27:40.252870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.conll-1.34","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"45539a38-b3ee-45fb-be69-5fc1f20f37c3","year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.235186Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:fdacd40e421d05735196e0041acb6c3c0403a65aa5aefafa775b567c2cfc61a0","observation_id":"427b46ef-5ae3-46dc-a62b-30d54a780374","resolution":{"observed_at":"2026-08-06T10:27:39.600141Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01496","last_updated":"2019-12-03T16:16:13Z","snapshot_observed_at":"2026-07-06T08:41:44.431340Z","submitted_at":"2019-12-03T16:16:13Z","title":"Knowledge-Enriched Visual Storytelling","version":1},"cited_work":{"arxiv_id":"1912.01496","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.01496","snapshot_observed_at":"2026-08-06T10:27:40.233690Z","title":"Knowledge-Enriched Visual Storytelling","venue":"cs.CL","work_id":"1c844b77-e781-4663-b851-e3e197e38b06","year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.238764Z"},"links":{"cited_paper":"/paper/1912.01496","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:2650403cef294986786f144e2439f932e485268dec8b58bb48efc7f1a3fa30c3","observation_id":"8e834285-e94b-4497-8653-3365b1d32738","resolution":{"observed_at":"2026-08-06T10:27:40.237734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06950","last_updated":"2021-07-07T14:59:28Z","snapshot_observed_at":"2026-07-06T11:09:34.784058Z","submitted_at":"2021-05-14T16:41:29Z","title":"Plot and Rework: Modeling Storylines for Visual Storytelling","version":3},"cited_work":{"arxiv_id":"2105.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.06950","snapshot_observed_at":"2026-08-06T10:27:40.219736Z","title":"Plot and Rework: Modeling Storylines for Visual Storytelling","venue":"cs.CL","work_id":"90fadafb-7b38-41d4-8a6a-c8209c2697d4","year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.242438Z"},"links":{"cited_paper":"/paper/2105.06950","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:f659d1dda254c292c006d19786ae21f6f92b4d3c4c170aefcbbffff03c710103","observation_id":"3e16745c-30a3-48a8-a26b-a174808360ba","resolution":{"observed_at":"2026-08-06T10:27:40.223637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01764","last_updated":"2019-06-05T00:33:47Z","snapshot_observed_at":"2026-08-07T23:01:44.242605Z","submitted_at":"2019-06-05T00:33:47Z","title":"Visual Story Post-Editing","version":1},"cited_work":{"arxiv_id":"1906.01764","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.01764","snapshot_observed_at":"2026-08-06T10:27:40.205325Z","title":"Visual Story Post-Editing","venue":"cs.CL","work_id":"9572d876-aa1d-4355-89b5-8406b7e8eef4","year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.246217Z"},"links":{"cited_paper":"/paper/1906.01764","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:d0ce8696a51836d196a4f1172b099d61162a669f7bbae22b9ef30f8e36f2337c","observation_id":"4c1f7389-1b57-4464-b4c2-bdee5178d99b","resolution":{"observed_at":"2026-08-06T10:27:40.209796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05316","last_updated":"2020-02-25T19:49:21Z","snapshot_observed_at":"2026-08-04T07:11:57.294727Z","submitted_at":"2019-09-11T19:17:03Z","title":"What Makes A Good Story? Designing Composite Rewards for Visual Storytelling","version":2},"cited_work":{"arxiv_id":"1909.05316","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.05316","snapshot_observed_at":"2026-08-06T10:27:40.189542Z","title":"What Makes A Good Story? Designing Composite Rewards for Visual Storytelling","venue":"cs.CL","work_id":"158ff7ac-5e3d-44fd-a900-30601891e444","year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.250137Z"},"links":{"cited_paper":"/paper/1909.05316","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:33907b68cbc4a415bfbd23a3be3e607359d0e30a8d3a73270f6c450acd1ddbdd","observation_id":"105aa1fc-90dc-4512-b17e-786916095155","resolution":{"observed_at":"2026-08-06T10:27:40.194184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06954","last_updated":"2019-08-21T17:58:38Z","snapshot_observed_at":"2026-08-07T15:18:10.123293Z","submitted_at":"2019-08-19T17:44:14Z","title":"Attention on Attention for Image Captioning","version":2},"cited_work":{"arxiv_id":"1908.06954","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.06954","snapshot_observed_at":"2026-08-06T10:27:40.175279Z","title":"Attention on Attention for Image Captioning","venue":"cs.CV","work_id":"da53a596-e4bb-491e-922e-d3fae629ee3f","year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.254800Z"},"links":{"cited_paper":"/paper/1908.06954","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:95a111de71dea7590681ae356c80a8384931249274bd124b9c4490a528be0bec","observation_id":"c67cc21f-a03e-440f-ae93-4237f8229808","resolution":{"observed_at":"2026-08-06T10:27:40.179323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n16-1147","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Lawrence Zitnick, Devi Parikh, Lucy Vanderwende, Galley Michel, and Mitchell Margaret","venue":null,"work_id":"13cfadd3-5fd1-40de-bd30-fe4620ee08e0","year":2016},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.258864Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:d54e9077dcd724e658bbcac800b146f3d2ad938c607e08ad0974d4fee3d37bb2","observation_id":"2ad04455-f1e3-4249-86cb-1b4716457b81","resolution":{"observed_at":"2026-08-06T10:27:39.589103Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05501","last_updated":"2017-08-21T13:25:21Z","snapshot_observed_at":"2026-08-08T04:12:19.557236Z","submitted_at":"2017-07-18T07:08:31Z","title":"Story Generation from Sequence of Independent Short Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05501","snapshot_observed_at":"2026-08-06T10:27:39.262362Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.262362Z"},"links":{"cited_paper":"/paper/1707.05501","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:4bbe2f4e0681392dafc1a13d464fc848382929293d1f760521ac14829f30a8a8","observation_id":"a2cdddcc-5ee7-4e64-9a08-7c793b365491","resolution":{"observed_at":"2026-08-06T10:27:39.262362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.266799Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.266799Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:3dda554bd54942dbe1cd7ea4333e0aeebf4af46a70b3c75b3dfb6886cee1752e","observation_id":"cbf1c71d-8fe6-485f-8532-77576a34ca9f","resolution":{"observed_at":"2026-08-06T10:27:39.266799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.270245Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.270245Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:545f07413894033b9235f11a342547c7127fe576800f6071d08148aaf9e398cf","observation_id":"51554768-4817-4571-ac6e-fc292c53417a","resolution":{"observed_at":"2026-08-06T10:27:39.270245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.10973","last_updated":"2019-02-13T05:27:28Z","snapshot_observed_at":"2026-07-06T06:41:36.871103Z","submitted_at":"2018-05-28T15:30:21Z","title":"GLAC Net: GLocal Attention Cascading Networks for Multi-image Cued Story Generation","version":3},"cited_work":{"arxiv_id":"1805.10973","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.10973","snapshot_observed_at":"2026-08-06T10:27:40.150651Z","title":"GLAC Net: GLocal Attention Cascading Networks for Multi-image Cued Story Generation","venue":"cs.CL","work_id":"71ab391e-bdea-4386-865a-2a405bae96ce","year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.274281Z"},"links":{"cited_paper":"/paper/1805.10973","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:b2fc298fc8e6598857485d64115b49a1ba14dcd867e6a7769f0c1ea4f58769fa","observation_id":"419e3971-28c0-48b6-a6b4-af2f9f896912","resolution":{"observed_at":"2026-08-06T10:27:40.154163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T10:27:39.278137Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.278137Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:33d32e596aabe2900fa30a5bb2a413b16ef70554f59aa6afb78f9a6f3dadc117","observation_id":"c8910c74-efb6-4850-a6c5-12a63ed028af","resolution":{"observed_at":"2026-08-06T10:27:39.278137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-07-06T04:47:08.658688Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-06T10:27:39.281717Z","title":"Shamma, Michael S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.281717Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:f3ad78d59944ef5740950be9c126b172764aec51563686ed9fc109cdae5d005e","observation_id":"989190ee-ceb5-4ac2-ad7f-c3b8d92420f6","resolution":{"observed_at":"2026-08-06T10:27:39.281717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.285646Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.285646Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:ca899ce062270f6e042ac414e07e4f09a5b61576aedaf37e72887fa7ee6ca806","observation_id":"2e146646-9bd6-4472-a3fd-c05ec8112898","resolution":{"observed_at":"2026-08-06T10:27:39.285646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01783","last_updated":"2023-10-03T04:14:17Z","snapshot_observed_at":"2026-08-03T02:36:19.000729Z","submitted_at":"2023-10-03T04:14:17Z","title":"Can large language models provide useful feedback on research papers? A large-scale empirical analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01783","snapshot_observed_at":"2026-08-06T10:27:39.290156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.290156Z"},"links":{"cited_paper":"/paper/2310.01783","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:2a92b102a09756795fdb3d8c83d6a11905a64a0f7447ac9a1658f65950523ab3","observation_id":"903672af-7ab0-4424-88f5-2d33bebc4e7e","resolution":{"observed_at":"2026-08-06T10:27:39.290156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.295020Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.295020Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:73080d84b97a45ba6684480dd3fbbca4cb612de3beb2af3fa7f1e36258ca5695","observation_id":"3da6f782-8b0d-4469-a45b-045a2cc88fde","resolution":{"observed_at":"2026-08-06T10:27:39.295020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-06T10:27:39.299512Z","title":"Belongie, Lubomir D","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.299512Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:7edb130a1bc696617ba63ecd511db40c59f8dc387e2139d6ebe3ba4fe81f56a4","observation_id":"73029131-2d63-47bd-8138-b5e332d5cf80","resolution":{"observed_at":"2026-08-06T10:27:39.299512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17647","last_updated":"2023-03-30T18:24:06Z","snapshot_observed_at":"2026-07-06T15:10:15.773528Z","submitted_at":"2023-03-30T18:24:06Z","title":"Detecting and Grounding Important Characters in Visual Stories","version":1},"cited_work":{"arxiv_id":"2303.17647","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17647","snapshot_observed_at":"2026-08-06T10:27:40.098042Z","title":"Detecting and Grounding Important Characters in Visual Stories","venue":"cs.CL","work_id":"583d9f5e-4729-40ba-863d-4969ee88f6dd","year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.303627Z"},"links":{"cited_paper":"/paper/2303.17647","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:ade4f42132e79cedda736c2f215d5b5efc9e513bfd467ef44c3a7400e0c52ad0","observation_id":"058e1eda-5b59-432e-b044-8063073aa986","resolution":{"observed_at":"2026-08-06T10:27:40.101851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13555","last_updated":"2025-03-02T14:36:29Z","snapshot_observed_at":"2026-07-06T19:18:45.024436Z","submitted_at":"2024-09-20T14:56:33Z","title":"Generating Visual Stories with Grounded and Coreferent Characters","version":2},"cited_work":{"arxiv_id":"2409.13555","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13555","snapshot_observed_at":"2026-08-06T10:27:40.082999Z","title":"Generating Visual Stories with Grounded and Coreferent Characters","venue":"cs.CL","work_id":"e89feac1-4ae3-4ee3-90c0-651447be8d9d","year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.307440Z"},"links":{"cited_paper":"/paper/2409.13555","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:84514e0f4d6b4061a4bce5c4e272315146b51f6c14ba67ee5cd867e2b43db919","observation_id":"6e3ab560-f4dc-4e6e-8d2c-973f8c351b55","resolution":{"observed_at":"2026-08-06T10:27:40.087549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.311506Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.311506Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:b0a668e9c9ce513554019bf5f85f54274cce58181ef925c1f379e3e0fdc2c567","observation_id":"57653fa1-3860-4cc6-a222-ce63084026dd","resolution":{"observed_at":"2026-08-06T10:27:39.311506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T10:27:39.315063Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.315063Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:1155bfc71cd56a259ef9fad76ee881bbd7096d0c467ecb42d5a6db07366837ab","observation_id":"da206540-3816-4e31-b2b8-531f42f8f6d2","resolution":{"observed_at":"2026-08-06T10:27:39.315063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.318888Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.318888Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:8c3d5fdbf20d017296afd1c59078d29b39a7e3e55a7581a3b82c6ddec84deed9","observation_id":"fdee897e-d3b5-402d-8946-069e6a5a8903","resolution":{"observed_at":"2026-08-06T10:27:39.318888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.322346Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.322346Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:174414983bcce029a3771712ffcd51934ed627bb12c0a1ab40c06f7667ba58e3","observation_id":"fffd135f-d63d-4b72-8ed5-9e1082cc1057","resolution":{"observed_at":"2026-08-06T10:27:39.322346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T10:27:39.325723Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.325723Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:dc499b57f945f5dbb0e8d215569114600a30fee9a134d8c5d6e0c237d28be06b","observation_id":"43d4022d-768c-44cc-8564-49fa5ed5d58c","resolution":{"observed_at":"2026-08-06T10:27:39.325723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-07-06T08:12:46.398794Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-06T10:27:39.329615Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.329615Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:215f7a52bc993f350d410ac36e6539873125dfcf947f666307f7604402e47c90","observation_id":"e585f74d-cd12-4a2c-a89d-fea58f28007f","resolution":{"observed_at":"2026-08-06T10:27:39.329615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01887","last_updated":"2017-06-06T06:59:15Z","snapshot_observed_at":"2026-07-06T05:21:35.353268Z","submitted_at":"2016-12-06T16:03:50Z","title":"Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning","version":2},"cited_work":{"arxiv_id":"1612.01887","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.01887","snapshot_observed_at":"2026-08-06T10:27:40.038650Z","title":"Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning","venue":"cs.CV","work_id":"0821b340-c329-47f2-8dd4-2dde7a6068ee","year":2016},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.334282Z"},"links":{"cited_paper":"/paper/1612.01887","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:c14ce4c78795134f86589c6614b5261dc5dd731ce75ee07d5a94fb362e3ae403","observation_id":"6c4c66f5-985b-494a-9897-bab94d50dfca","resolution":{"observed_at":"2026-08-06T10:27:40.043109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T10:27:39.338214Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.338214Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:ebcf05311ba5fc8b5508ab9ab0f1f4e7932e0223e4857ec5b19098d1f5c103b2","observation_id":"37b79eda-e591-486e-aa15-4fabec394308","resolution":{"observed_at":"2026-08-06T10:27:39.338214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12943","last_updated":"2023-05-24T02:58:03Z","snapshot_observed_at":"2026-08-02T07:01:46.824815Z","submitted_at":"2023-05-22T11:45:10Z","title":"Album Storytelling with Iterative Story-aware Captioning and Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.12943","snapshot_observed_at":"2026-08-06T10:27:40.013162Z","title":"Album Storytelling with Iterative Story-aware Captioning and Large Language Models","venue":"cs.CV","work_id":"59d7a135-339c-41f6-bc6e-4ebc04c4069a","year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.341873Z"},"links":{"cited_paper":"/paper/2305.12943","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:1bc1ae218eee9071f40d415a0fa4e4c0cb8edefcb66c53f06ad8b4bb7217d2bc","observation_id":"a0104fdd-bca1-41ec-ab2c-d9117d4ee5fe","resolution":{"observed_at":"2026-08-06T10:27:40.017233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T10:27:39.345535Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.345535Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:88a613ee859501f79c8b065d7100be97f66a39e0e64062ddf1ec58ac7ea4610d","observation_id":"ec36a8b8-11dd-4cfd-b7ad-2a5f9824ceee","resolution":{"observed_at":"2026-08-06T10:27:39.345535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.349238Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.349238Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:8c3c5d69a08540e945d74ef6290af62cae95b17b2d9322c7981cc2236670fbcc","observation_id":"0f4f6d66-e639-4762-b23a-42658458b030","resolution":{"observed_at":"2026-08-06T10:27:39.349238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.696336Z","title":null,"venue":null,"work_id":"daebd0ea-65b4-4294-8088-e02c27b8a11e","year":2015},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.353116Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:80fa6ab4061511f26fcf56437149ab1f863fb58a46cde8e8f19e648a803db844","observation_id":"687713ed-6311-4c42-892c-7f49a7474639","resolution":{"observed_at":"2026-08-06T10:27:40.699746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06401","last_updated":"2019-06-14T21:00:20Z","snapshot_observed_at":"2026-07-06T08:00:28.108655Z","submitted_at":"2019-06-14T21:00:20Z","title":"\"My Way of Telling a Story\": Persona based Grounded Story Generation","version":1},"cited_work":{"arxiv_id":"1906.06401","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.06401","snapshot_observed_at":"2026-08-06T10:27:39.989144Z","title":"\"My Way of Telling a Story\": Persona based Grounded Story Generation","venue":"cs.CL","work_id":"54866230-c00a-4544-8f53-50a47430f2ee","year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.356460Z"},"links":{"cited_paper":"/paper/1906.06401","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:015b83e2766b9dca54368450674059b0fad3cff5c11c124aeb86339353e0048d","observation_id":"554ae120-bd17-4590-901f-7cb3c32814d2","resolution":{"observed_at":"2026-08-06T10:27:39.993159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4085.34752","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.970540Z","title":null,"venue":null,"work_id":"68ee003e-f77b-45f9-b204-0045f9cca393","year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.360161Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:01cefab6942e9be1a9333a58be058ecd91ec3faab1f1e27e5e858f76e74c75d0","observation_id":"18cf3879-f740-46b8-a74e-c2dd89070af7","resolution":{"observed_at":"2026-08-06T10:27:39.978523Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.686030Z","title":null,"venue":null,"work_id":"ab65110c-846b-4b4c-8e1c-1f2c5d3daeb5","year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.363586Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:68b51c2690df1683a9a614a63b41dde00134d934b4c4abc5e42274126f700c9a","observation_id":"043bfdfd-ae57-491c-b34e-a2cf088ec02b","resolution":{"observed_at":"2026-08-06T10:27:40.689280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.367121Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.367121Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:6a26dc5cfc59fbad64fcfeddd2d9573db9aae5e52c90a36540115b7ea29068ab","observation_id":"e60aa79e-f929-44e9-aadd-fe864c611ff1","resolution":{"observed_at":"2026-08-06T10:27:39.367121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.370515Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.370515Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:456161bd310dfe2d8c27c9d90db97a8d0b349b57cf66b13eb2358fc7b055edb6","observation_id":"952d01be-fd97-4645-b3dd-1138179d7cd9","resolution":{"observed_at":"2026-08-06T10:27:39.370515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.373867Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.373867Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:b7cda55c2c6d6978355ed62145c5427697b3de0dc360ac3b83a7b88925640929","observation_id":"13985ff9-03a2-4143-9bed-a6cec49e6f69","resolution":{"observed_at":"2026-08-06T10:27:39.373867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.656866Z","title":null,"venue":null,"work_id":"5958632f-4a3b-4c46-994e-2f737c16abc2","year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.377562Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:7af1eabbdbc49ca1f0ab5313e51060e35b226f57bff9fdc2b4aaa67e26dd853a","observation_id":"edead90b-c421-48a6-b33d-d747ba762ea9","resolution":{"observed_at":"2026-08-06T10:27:40.660493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00563","last_updated":"2017-11-16T02:38:37Z","snapshot_observed_at":"2026-08-03T07:07:22.143109Z","submitted_at":"2016-12-02T04:37:22Z","title":"Self-critical Sequence Training for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00563","snapshot_observed_at":"2026-08-06T10:27:39.381077Z","title":"Rennie, Etienne Marcheret, Youssef Mroueh, Jarret Ross, and Vaibhava Goel","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.381077Z"},"links":{"cited_paper":"/paper/1612.00563","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:c464c33070b6635cbb744c65226dd41d4b7a973bd9c8a16bc737dcfd76ed7344","observation_id":"94a30da2-4380-4351-9805-5a4ed67bfcc8","resolution":{"observed_at":"2026-08-06T10:27:39.381077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.384650Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.384650Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:b6949533c5bb133430303242df501335068c7acc87f2f1ed23be512261487c87","observation_id":"557f3364-c092-41db-96b4-739057dc3d61","resolution":{"observed_at":"2026-08-06T10:27:39.384650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.644856Z","title":null,"venue":null,"work_id":"fd8c5202-dfc3-47f6-a543-ddb3e5c5d5ce","year":1948},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.387909Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:11d0439fe5c75d96cbf7a6f8353f30de4308c29ea0b3d0653d894c30318b7d00","observation_id":"217a277e-110f-4fa1-a021-7f4e7464098c","resolution":{"observed_at":"2026-08-06T10:27:40.649191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-00825-3_13","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:33.414567Z","title":null,"venue":"Communications in computer and information science","work_id":"8d918732-e5f2-406d-8ae4-9980158e650b","year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.391257Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:a02cdcae27cb035cd91191701f1fe8bc520a4a31171f2c2684f86be3dc31308c","observation_id":"231da63b-840f-4809-bb7e-7ac72fb0b435","resolution":{"observed_at":"2026-08-06T10:27:39.565514Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06259","last_updated":"2024-08-12T16:15:32Z","snapshot_observed_at":"2026-08-03T05:18:09.331936Z","submitted_at":"2024-08-12T16:15:32Z","title":"Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2408.06259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.06259","snapshot_observed_at":"2026-08-06T10:27:39.891130Z","title":"Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning","venue":"cs.CL","work_id":"64e8c6a5-57ae-481c-98b1-41a1330fd3fa","year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.394862Z"},"links":{"cited_paper":"/paper/2408.06259","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:699b6574d300dc6f97e890d967e1465fe3dfb50cef3220d4c891d8e41761e523","observation_id":"33fc1b98-a558-4f14-aa29-ef4449227539","resolution":{"observed_at":"2026-08-06T10:27:39.895991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.02128","last_updated":"2020-12-03T18:07:28Z","snapshot_observed_at":"2026-08-01T16:51:46.711951Z","submitted_at":"2020-12-03T18:07:28Z","title":"BERT-hLSTMs: BERT and Hierarchical LSTMs for Visual Storytelling","version":1},"cited_work":{"arxiv_id":"2012.02128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.02128","snapshot_observed_at":"2026-08-06T10:27:39.876625Z","title":"BERT-hLSTMs: BERT and Hierarchical LSTMs for Visual Storytelling","venue":"cs.CL","work_id":"7d636dad-8968-4c08-9f32-069e34b93701","year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.398532Z"},"links":{"cited_paper":"/paper/2012.02128","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:4094be26f494f5b859d287ef2ec6e2510dbe5d622de7d416b1aa3c00354c8cb2","observation_id":"d456efa1-f29f-4fc5-a19c-783add29eff0","resolution":{"observed_at":"2026-08-06T10:27:39.880542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06417","last_updated":"2022-09-26T14:59:44Z","snapshot_observed_at":"2026-08-06T04:48:30.423669Z","submitted_at":"2022-02-13T21:46:14Z","title":"A Contrastive Framework for Neural Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06417","snapshot_observed_at":"2026-08-06T10:27:39.402209Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.402209Z"},"links":{"cited_paper":"/paper/2202.06417","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:0ed7a7c3f48bf09b8b9e6dc91fbe6f61a503dc437a6eafef60bd93d1e7b1d72f","observation_id":"896b20bb-827b-4a89-a7f0-d91bfc9c3f1f","resolution":{"observed_at":"2026-08-06T10:27:39.402209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17770","last_updated":"2023-10-26T20:27:16Z","snapshot_observed_at":"2026-07-06T16:39:12.627366Z","submitted_at":"2023-10-26T20:27:16Z","title":"GROOViST: A Metric for Grounding Objects in Visual Storytelling","version":1},"cited_work":{"arxiv_id":"2310.17770","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.17770","snapshot_observed_at":"2026-08-06T10:27:39.852189Z","title":"GROOViST: A Metric for Grounding Objects in Visual Storytelling","venue":"cs.AI","work_id":"0b32f69d-1947-4362-926b-0cc81d8f3481","year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.406036Z"},"links":{"cited_paper":"/paper/2310.17770","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:fdd5929010fdcb27c201e4808787e2cf7261ff71408b960bb99748d5ec62c84f","observation_id":"3cf0b8ea-ae3c-4ba7-b452-e0a68339f0c8","resolution":{"observed_at":"2026-08-06T10:27:39.856031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.410173Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.410173Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:14c19e3a14a0a09a7e250826f06c66c93adfaea13e3c58cec0dba1f432079ad2","observation_id":"dda0013f-0dc2-4353-87e1-1a443e757f60","resolution":{"observed_at":"2026-08-06T10:27:39.410173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T10:27:39.413633Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.413633Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:28b42758108a462ec1927e9904267339fe193cda03bd450d308104bba313a557","observation_id":"f8082d88-3674-49a4-ada3-2f159cb73630","resolution":{"observed_at":"2026-08-06T10:27:39.413633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-08-07T17:52:59.562945Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-08-06T10:27:39.417323Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.417323Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:2627555f209068c095f4031b5ef0b153f89eaca25f34c5b4afee97e7329616a0","observation_id":"fb173263-4328-4989-b022-42b86e67887d","resolution":{"observed_at":"2026-08-06T10:27:39.417323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.4555","last_updated":"2015-04-20T22:26:11Z","snapshot_observed_at":"2026-08-05T19:52:52.260168Z","submitted_at":"2014-11-17T17:15:41Z","title":"Show and Tell: A Neural Image Caption Generator","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.4555","snapshot_observed_at":"2026-08-06T10:27:39.421035Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.421035Z"},"links":{"cited_paper":"/paper/1411.4555","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:0114e28024587cbd246f73b31550a75019f1f67909de56bde394e6cd70e49592","observation_id":"b32d3152-5ffd-4c64-bbae-1b51149e54a4","resolution":{"observed_at":"2026-08-06T10:27:39.421035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03774","last_updated":"2022-05-08T03:51:22Z","snapshot_observed_at":"2026-07-06T13:07:44.802145Z","submitted_at":"2022-05-08T03:51:22Z","title":"RoViST:Learning Robust Metrics for Visual Storytelling","version":1},"cited_work":{"arxiv_id":"2205.03774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.03774","snapshot_observed_at":"2026-08-06T10:27:39.808279Z","title":"RoViST:Learning Robust Metrics for Visual Storytelling","venue":"cs.CV","work_id":"108af46e-8093-4cfc-ba0c-45dd3552ec80","year":2022},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.424827Z"},"links":{"cited_paper":"/paper/2205.03774","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:67a98daabae23a4189d9314ea78b74d11a7a0abb5e77f7fd14a26777896f81b7","observation_id":"5c2aa0b5-1d93-4188-be11-52d9e6166858","resolution":{"observed_at":"2026-08-06T10:27:39.812385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00319","last_updated":"2024-02-01T04:09:17Z","snapshot_observed_at":"2026-08-07T06:40:49.920691Z","submitted_at":"2024-02-01T04:09:17Z","title":"SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling","version":1},"cited_work":{"arxiv_id":"2402.00319","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.00319","snapshot_observed_at":"2026-08-06T10:27:39.792911Z","title":"SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling","venue":"cs.CV","work_id":"bacb4256-366b-4239-bb99-c91f2b959e07","year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.428595Z"},"links":{"cited_paper":"/paper/2402.00319","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:608becfef374df878647bdb879b9de85b076665c431a5595401f1f0afb6f0c54","observation_id":"1ce7e186-bbf4-4ec8-a59a-7397098b1477","resolution":{"observed_at":"2026-08-06T10:27:39.797114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.633182Z","title":null,"venue":null,"work_id":"8372331b-28f5-4f8d-8cd5-27a561dc1d87","year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.432373Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:1940eae17d81c0ec4b5125b58314b6b375b873364b6ce62636803d56de5d65cc","observation_id":"3aa95786-b222-4c36-93f7-c096dbe5113a","resolution":{"observed_at":"2026-08-06T10:27:40.636867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6455","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"db7fc72c-9615-49b7-ad6d-b97dafff91e6","year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.435892Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:8db3a84ed965c1b87abd76e08b80ad1705e52cc797f0ceaac70d117c02ce4052","observation_id":"b091807c-d599-4f50-915b-7ddf03bc2b1f","resolution":{"observed_at":"2026-08-06T10:27:39.547730Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09160","last_updated":"2018-07-09T00:15:14Z","snapshot_observed_at":"2026-07-06T06:35:12.532286Z","submitted_at":"2018-04-24T17:41:24Z","title":"No Metrics Are Perfect: Adversarial Reward Learning for Visual Storytelling","version":2},"cited_work":{"arxiv_id":"1804.09160","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.09160","snapshot_observed_at":"2026-08-06T10:27:39.776787Z","title":"No Metrics Are Perfect: Adversarial Reward Learning for Visual Storytelling","venue":"cs.CL","work_id":"efcee770-bf06-44dc-961a-134aabacc3b9","year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.439808Z"},"links":{"cited_paper":"/paper/1804.09160","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:4fd3f14cdc4eebf92e62f3763e29b305f4e5a14099f1d2e1efa7836efec269c5","observation_id":"02c3b8ec-8ce0-4881-b390-f8d6d5f5dab1","resolution":{"observed_at":"2026-08-06T10:27:39.781778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:39.443605Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.443605Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:260924837c1470c5880906897b44a4da4f17e2e96c19a0889b25bc9267a3655a","observation_id":"a5e90f3d-6977-4b6f-978e-86667d9f41a6","resolution":{"observed_at":"2026-08-06T10:27:39.443605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04709","last_updated":"2023-08-09T05:01:28Z","snapshot_observed_at":"2026-07-06T16:04:15.121439Z","submitted_at":"2023-08-09T05:01:28Z","title":"A Comparative Study of Open-Source Large Language Models, GPT-4 and Claude 2: Multiple-Choice Test Taking in Nephrology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04709","snapshot_observed_at":"2026-08-06T10:27:39.447385Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.447385Z"},"links":{"cited_paper":"/paper/2308.04709","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:66627faf4eb117a6c4857be39ebf7ec51228b3e3b6c7ab619893dcdd5c72f271","observation_id":"2e7bb518-1332-4a8b-9932-b8d85a7200b3","resolution":{"observed_at":"2026-08-06T10:27:39.447385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.622543Z","title":null,"venue":null,"work_id":"58bf0b74-925e-4bea-9cc0-ebb21c25ab9b","year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.450741Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:4858164c25d937420324bbd10e17aeb03bae1bfd4ec11b2a8b9ef02165f7face","observation_id":"b90fe462-ddb0-4e97-b1c7-6b6410a24976","resolution":{"observed_at":"2026-08-06T10:27:40.625992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03044","last_updated":"2016-04-19T16:43:09Z","snapshot_observed_at":"2026-08-08T08:37:34.322347Z","submitted_at":"2015-02-10T19:18:29Z","title":"Show, Attend and Tell: Neural Image Caption Generation with Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03044","snapshot_observed_at":"2026-08-06T10:27:39.454437Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.454437Z"},"links":{"cited_paper":"/paper/1502.03044","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:ecac8c14e7d084f33f5d8a3bf66b1f32f098df61e6545a838dc5db14a6d36437","observation_id":"e22c170b-500e-49d1-a96d-3afe984aa08d","resolution":{"observed_at":"2026-08-06T10:27:39.454437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.226","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"b7612f23-4eae-4e83-8bc1-daa4c1dfe1d8","year":2020},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.458015Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:aa8a31b3d1ac01011860b1fc42cab973840d1a01e544a8b998aa18936b6d0349","observation_id":"e6ee732c-a3a7-49e1-a83b-bf8ca9c895cc","resolution":{"observed_at":"2026-08-06T10:27:39.536839Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.619","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"c9da6400-c0dc-4f36-8358-2f6f23e84f12","year":2023},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.461591Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:7a445bcdd5f18ce602cdfb268ebbe6fdb74496999f9190f4177b1a43990db121","observation_id":"60ad4f21-f899-4498-8fa3-30c6c4fbf7fa","resolution":{"observed_at":"2026-08-06T10:27:39.525086Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.611964Z","title":null,"venue":null,"work_id":"7eb3f634-d68f-4695-b78a-b132c7dcc880","year":2025},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.465764Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:ef98769e4217f5b6d24953d6989b19e9318121c7987ffb61ad70a4ad02630aee","observation_id":"77d70103-ca16-4fff-aed7-5b5f4e1da0aa","resolution":{"observed_at":"2026-08-06T10:27:40.615483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.601431Z","title":null,"venue":null,"work_id":"3b13e7d3-ab80-4361-9519-26036b01d73f","year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.469781Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:e6912732384338610e4a6f417c6ec9e1217252326e6759ac352e81d54376a138","observation_id":"b5e64da4-7ca6-48b4-b0dc-63abf58a9530","resolution":{"observed_at":"2026-08-06T10:27:40.605045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02378","last_updated":"2018-12-11T01:32:43Z","snapshot_observed_at":"2026-08-05T01:01:15.658437Z","submitted_at":"2018-12-06T07:13:33Z","title":"Auto-Encoding Scene Graphs for Image Captioning","version":3},"cited_work":{"arxiv_id":"1812.02378","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.02378","snapshot_observed_at":"2026-08-06T10:27:39.664986Z","title":"Auto-Encoding Scene Graphs for Image Captioning","venue":"cs.CV","work_id":"9c7e72c3-5058-441c-a7a3-19057ea5c857","year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.473297Z"},"links":{"cited_paper":"/paper/1812.02378","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:ad1a441cfe2dc7c89b27f92f3f517004249f470f05aff7a00f57a388364f2564","observation_id":"97cfa074-f42b-4275-8a3a-3693350a57af","resolution":{"observed_at":"2026-08-06T10:27:39.669306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.05701","last_updated":"2019-02-19T06:43:42Z","snapshot_observed_at":"2026-07-06T07:14:36.295416Z","submitted_at":"2018-11-14T09:37:40Z","title":"Plan-And-Write: Towards Better Automatic Storytelling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.05701","snapshot_observed_at":"2026-08-06T10:27:39.477116Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.477116Z"},"links":{"cited_paper":"/paper/1811.05701","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:3dda91d7e267b2326ae8a85c1396beee0af490c40427b0481803c0d21b03bb07","observation_id":"ad058722-43bc-4b39-ab1e-06cda13bbe28","resolution":{"observed_at":"2026-08-06T10:27:39.477116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.07041","last_updated":"2018-09-19T07:50:17Z","snapshot_observed_at":"2026-07-06T07:03:01.983356Z","submitted_at":"2018-09-19T07:50:17Z","title":"Exploring Visual Relationship for Image Captioning","version":1},"cited_work":{"arxiv_id":"1809.07041","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.07041","snapshot_observed_at":"2026-08-06T10:27:39.641494Z","title":"Exploring Visual Relationship for Image Captioning","venue":"cs.CV","work_id":"d23ba7bf-0322-4400-b212-9c4b14d43a31","year":2018},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.480734Z"},"links":{"cited_paper":"/paper/1809.07041","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:8c8fde51a4fe691e0f155f5a61a44b7f81f6c1519f3ed79e654d855f8e6aa047","observation_id":"c6a4ef8e-df43-43c9-9b35-1b91c819723a","resolution":{"observed_at":"2026-08-06T10:27:39.645511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02977","last_updated":"2017-08-09T19:26:47Z","snapshot_observed_at":"2026-08-01T14:38:01.245431Z","submitted_at":"2017-08-09T19:26:47Z","title":"Hierarchically-Attentive RNN for Album Summarization and Storytelling","version":1},"cited_work":{"arxiv_id":"1708.02977","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.02977","snapshot_observed_at":"2026-08-06T10:27:39.626598Z","title":"Hierarchically-Attentive RNN for Album Summarization and Storytelling","venue":"cs.CL","work_id":"1c17f711-a6ff-49a2-a504-87763e422dfb","year":2017},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.484397Z"},"links":{"cited_paper":"/paper/1708.02977","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:1f641636706e47caed340730e57e690da182375f9aee6e63a56f1217b9464004","observation_id":"312199dd-8e2a-4cf3-9e5c-4e18d5bd2259","resolution":{"observed_at":"2026-08-06T10:27:39.631169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:27:40.590689Z","title":null,"venue":null,"work_id":"7a66a773-4826-4b51-a574-d2566230e44a","year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.487868Z"},"links":{"citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:d29e284593a11aa84cea2a6530cbfedd8cfd373c75ce4aeb597ad899592145af","observation_id":"d3d47cb8-d634-4809-bf01-5d2ea0aafcab","resolution":{"observed_at":"2026-08-06T10:27:40.594457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-05T23:14:02.467264Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-06T10:27:39.491216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.491216Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:ea590f3167a41606f743fa64aaef37f1f4eda6b748ed42ca6558a3a1793753a3","observation_id":"29a3e9b4-a2d3-46c1-80dc-c3f24e36a74e","resolution":{"observed_at":"2026-08-06T10:27:39.491216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T21:56:01.166482Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":56,"verified_exact":34,"verified_fuzzy":0},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2508.14045."}