{"as_of":"2026-08-15T15:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d68d843d9b57724a108ab05ae9f3b45bd459db9dd5374302a0e8d0f89b5bad6","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:54:04.946058Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1909.02489/citation-record","integrity":"/paper/1909.02489/integrity","json":"/paper/1909.02489/citation-record.json","paper":"/paper/1909.02489"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.361648Z","title":"Grounded compositional semantics for ﬁnding and describing images with sentences,","venue":null,"work_id":"355fa645-26e1-40ba-93fe-d88953aa74ed","year":2014},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.835608Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:fd12206a7fd7e54b132ceab18a694d3ef8ca2e336285ec916311143fb3e42d3f","observation_id":"5271c8d7-f91e-4229-bb64-dd531300903e","resolution":{"observed_at":"2026-08-14T04:54:05.365653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.1090","last_updated":"2014-10-04T20:24:34Z","snapshot_observed_at":"2026-08-14T23:16:58.530575Z","submitted_at":"2014-10-04T20:24:34Z","title":"Explain Images with Multimodal Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.1090","snapshot_observed_at":"2026-08-14T04:54:04.839718Z","title":"Explain images with multimodal recurrent neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.839718Z"},"links":{"cited_paper":"/paper/1410.1090","citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:43a5fffcb4fe5990415c0a55d95f282eded6c01e05baa0feda6791403d4b3678","observation_id":"edff3a68-14f4-4011-acdb-e385d9c32882","resolution":{"observed_at":"2026-08-14T04:54:04.839718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.348295Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":"1f491890-1dc8-47de-8dc8-49a7664697b1","year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.843544Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:19de8f586c14fae0e411a88db207ea8a65cdfcfd1986658298b06d46e7b59a40","observation_id":"f824b446-a2ba-4477-a309-399d6369fbb4","resolution":{"observed_at":"2026-08-14T04:54:05.352318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:04.847349Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.847349Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:a85b07a1bf2cd233c71fb5d36679e750c8551841662b90d4f055b8de5fe99335","observation_id":"633ac000-b3ec-4262-a14b-d739611ef342","resolution":{"observed_at":"2026-08-14T04:54:04.847349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.328784Z","title":"What value do explicit high level concepts have in vision to language problems?","venue":null,"work_id":"a8023085-32c5-49a8-8109-b2f26e5f1e86","year":2016},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.850276Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:752eefd73a73c6212330519926b0282c5e5984a162c235f834150c533bbe3ece","observation_id":"a2690025-8471-410f-a58c-92b4edc65378","resolution":{"observed_at":"2026-08-14T04:54:05.332693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00887","last_updated":"2018-04-03T09:50:06Z","snapshot_observed_at":"2026-08-14T19:29:49.070651Z","submitted_at":"2018-04-03T09:50:06Z","title":"Learning to Guide Decoding for Image Captioning","version":1},"cited_work":{"arxiv_id":"1804.00887","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.00887","snapshot_observed_at":"2026-08-14T04:54:05.049079Z","title":"Learning to Guide Decoding for Image Captioning","venue":"cs.CV","work_id":"48e12e55-2f8f-4d7f-8525-3341e89ed012","year":2018},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.853093Z"},"links":{"cited_paper":"/paper/1804.00887","citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:0f5c0038d4b98fd555821c5f4ab1417b491153f5e20966ac65dbb030c6660e2e","observation_id":"d859782d-0415-4d35-a1e3-03ff3342d2ca","resolution":{"observed_at":"2026-08-14T04:54:05.053799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.317505Z","title":"Boosting image captioning with attributes,","venue":null,"work_id":"7893e0f0-e34e-406f-bce6-76d68f099ba1","year":2017},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.856659Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:91f018196c8d9a73e95d354100bcf3261701934ed6f1feafab034b4dca8487f8","observation_id":"20ce009d-762e-4c23-ab74-59dd47101b1e","resolution":{"observed_at":"2026-08-14T04:54:05.321435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.304584Z","title":"Long-term recurrent convolutional networks for visual recognition and description,","venue":null,"work_id":"c9aa4e53-22fd-4fc2-8c8c-dc4dd5c937f4","year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.859353Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:c5fc84f523666e9afc0ce2a20b3ece77d0265343067dae15a5b502d948ed66b6","observation_id":"50407182-5489-4c32-b4aa-69e8b8ddc515","resolution":{"observed_at":"2026-08-14T04:54:05.309260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.293244Z","title":"Show, attend and tell: Neural image caption generation with visual attention,","venue":null,"work_id":"b336668c-18c8-4a38-8b8c-c7ea618513fc","year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.861995Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:e608ce4a3d9bedc64378d6e4271b67f8ed22bdb821acd6579da4e83d85712e0e","observation_id":"9760106a-97ea-4421-a9e5-df028cecf750","resolution":{"observed_at":"2026-08-14T04:54:05.297203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.282540Z","title":"Composing simple image descriptions using web-scale n-grams,","venue":null,"work_id":"a45203ed-91f8-41eb-8a37-5121d03686a1","year":2011},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.864757Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:53da0a3d0ce5282e62a6d8ae12b7e91f95fb9832b4e3d1e33091b62c45f3beaa","observation_id":"90f0e4ca-c44b-48f7-b956-b5107ec9559b","resolution":{"observed_at":"2026-08-14T04:54:05.286263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.272216Z","title":"From captions to visual concepts and back,","venue":null,"work_id":"ef25d39f-3eef-447d-b409-adfdcdab2021","year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.867570Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:09b83aff02a3e1b42fcce240252831898285c4faef87a4bd5645c3c1715b4691","observation_id":"f0bd61e3-3ba9-49e2-8976-f136d088106b","resolution":{"observed_at":"2026-08-14T04:54:05.275515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.261254Z","title":"Image captioning with semantic attention,","venue":null,"work_id":"f50565e2-03f6-4ee7-8c51-132b9b7782d2","year":2016},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.870372Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:49455fe1e832df9db1e638752741c58f02396fd62d8033602480206c62b75490","observation_id":"8e94d150-d86f-4b1c-bb5c-acea114c07d1","resolution":{"observed_at":"2026-08-14T04:54:05.264806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.248669Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":"d43b1278-f4f8-4d0d-8369-8eb57e7a7f2e","year":2018},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.874210Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:2302104fc38037f459b19bc75c875cc0d7a9f6ef05c3fe73be667aede56173f2","observation_id":"048f97c5-045c-456d-9af4-4db1a0638267","resolution":{"observed_at":"2026-08-14T04:54:05.252864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.236495Z","title":"Long short-term memory","venue":null,"work_id":"144f2e99-e8a4-40a7-aa04-aa876b70baa5","year":null},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.877858Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:f73be4d99da6b9428ecb52982bd60bf40aa226c9ddcbac695283cc62736a323b","observation_id":"033a27d7-e3cf-40c3-87f4-35acffb7d0e7","resolution":{"observed_at":"2026-08-14T04:54:05.240370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.224593Z","title":"Long-term recurrent convolutional networks for visual recognition and description,","venue":null,"work_id":"c5c0e990-7892-43bf-9750-38643ba78827","year":null},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.881333Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:fbd83032a4f7a0c7535e10ab8df7390d8776795ae03bb5a7520a4b66dde2b7fb","observation_id":"f88c1b1b-4ad2-4236-bd21-3ae29400e9e3","resolution":{"observed_at":"2026-08-14T04:54:05.228583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.05658","last_updated":"2017-08-10T14:29:19Z","snapshot_observed_at":"2026-08-14T21:15:52.142868Z","submitted_at":"2017-02-18T21:35:06Z","title":"MAT: A Multimodal Attentive Translator for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.05658","snapshot_observed_at":"2026-08-14T04:54:04.884978Z","title":"Mat: A multimodal attentive translator for image captioning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.884978Z"},"links":{"cited_paper":"/paper/1702.05658","citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:907b55806fcabc68b3ffbfef97432478225035f27dcdb6ea4f0fb9091a2078fb","observation_id":"2638d605-6120-4794-a2fb-bcfd3d7a6e9b","resolution":{"observed_at":"2026-08-14T04:54:04.884978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.212042Z","title":"Knowing when to look: Adaptive attention via a visual sentinel for image captioning,","venue":null,"work_id":"32dc3644-fec5-48eb-93a5-2b476dd6ca56","year":2017},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.888810Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:4f3efe445da632712239471a5900539f2d7014207fd5cc59836806352af2c111","observation_id":"154d9a95-d587-4474-81a4-98465ffdf8f4","resolution":{"observed_at":"2026-08-14T04:54:05.216613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05594","last_updated":"2017-04-12T05:48:44Z","snapshot_observed_at":"2026-08-14T21:30:00.020339Z","submitted_at":"2016-11-17T07:39:46Z","title":"SCA-CNN: Spatial and Channel-wise Attention in Convolutional Networks for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05594","snapshot_observed_at":"2026-08-14T04:54:04.892361Z","title":"Sca-cnn: Spatial and channel-wise attention in convolutional networks for image captioning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.892361Z"},"links":{"cited_paper":"/paper/1611.05594","citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:88ae258334cc49d9223ca51f59d491d85ac4b72a315d66e39d6671cf3e9e9406","observation_id":"1d71ad26-d6c9-4b8f-a366-ebec72db68df","resolution":{"observed_at":"2026-08-14T04:54:04.892361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.199314Z","title":"Stack-captioning: Coarse-to-ﬁne learning for image captioning,","venue":null,"work_id":"00b3c1a8-7b0f-40de-a939-4c78cbc1cfd9","year":2018},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.896236Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:e3813ea1c3fd9ea7982ab3c2650ca2eeff924878dc1568410ce0ba8dce0b1702","observation_id":"fa9d3f40-5e18-4721-8954-8135f66858e3","resolution":{"observed_at":"2026-08-14T04:54:05.203275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:04.899424Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.899424Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:330a46f77a2b81ed9e5d3b7da2c23e71642d30cf67ab56efab87e158f6182e4d","observation_id":"77508de8-9732-4846-baf8-3a058ad019b5","resolution":{"observed_at":"2026-08-14T04:54:04.899424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.178850Z","title":"Self-critical sequence training for image captioning,","venue":null,"work_id":"f64fb7f5-c222-4166-8969-3f7e7462ebb5","year":2017},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.901955Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:eaa11367195350efbf3d45a2bf2e87eed55740bdd0ce3648add4763ffbf6ddbd","observation_id":"366f9cd0-3c39-4127-afb8-d0dd0220e61a","resolution":{"observed_at":"2026-08-14T04:54:05.182907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.167356Z","title":"Deep captioning with multimodal recurrent neural networks (m-rnn),","venue":null,"work_id":"324f3438-4eb6-4984-9271-6bb87c16fb50","year":2014},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.905106Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:7cf24b79411ffc9aaed27b94147d98ebeb2bd7a61288b63312386bedffdd010a","observation_id":"c9fd4ea3-f525-4ed1-92e9-930085560f67","resolution":{"observed_at":"2026-08-14T04:54:05.171355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.154538Z","title":"Review networks for caption generation,","venue":null,"work_id":"39a94343-4e9e-4874-91b3-c8ad17351ce9","year":2016},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.908388Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:a29a2ef8327cedeef5eadf9c44eef378da2ca63244be082abc61ea032d964ba4","observation_id":"dcb71e70-1e2d-491e-8d51-eee73a797dcf","resolution":{"observed_at":"2026-08-14T04:54:05.158688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.141853Z","title":"Gated hierarchical attention for image captioning,","venue":null,"work_id":"04c2c594-eb12-4d05-958b-1edf62292ce6","year":2018},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.911512Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:257235eef1e26bea123fef26fcd26a40a6af7986edbd332e705b1048a2d8da53","observation_id":"d471f483-2115-44d0-a45c-6e80272e0394","resolution":{"observed_at":"2026-08-14T04:54:05.146073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:04.915430Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.915430Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:23800d8a8a8a39b3082634956ff4f9f0649255fb222dda3f16e845bbd0698ee9","observation_id":"9bc62d48-1dd3-4bcf-bc5f-4f17bd85f076","resolution":{"observed_at":"2026-08-14T04:54:04.915430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06732","last_updated":"2016-05-06T21:18:46Z","snapshot_observed_at":"2026-08-14T22:21:58.983002Z","submitted_at":"2015-11-20T19:25:54Z","title":"Sequence Level Training with Recurrent Neural Networks","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06732","snapshot_observed_at":"2026-08-14T04:54:04.919052Z","title":"Sequence level train- ing with recurrent neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.919052Z"},"links":{"cited_paper":"/paper/1511.06732","citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:79ed35d036caaedce6148d2dae87484f72f54047b752620b0c89e42da1b5548f","observation_id":"9e92f6ea-38ab-4575-87e7-deeacaa9e58a","resolution":{"observed_at":"2026-08-14T04:54:04.919052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00370","last_updated":"2018-03-12T18:53:06Z","snapshot_observed_at":"2026-08-14T21:27:34.361390Z","submitted_at":"2016-12-01T18:10:48Z","title":"Improved Image Captioning via Policy Gradient optimization of SPIDEr","version":4},"cited_work":{"arxiv_id":"1612.00370","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.00370","snapshot_observed_at":"2026-08-14T04:54:04.990373Z","title":"Improved Image Captioning via Policy Gradient optimization of SPIDEr","venue":"cs.CV","work_id":"d8089971-09cc-4956-a962-9af7094d8b15","year":2016},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.922474Z"},"links":{"cited_paper":"/paper/1612.00370","citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:74ee12f01302554d89fc4818c7aec74ec861fdb6c36615c0cd308846aa9cef15","observation_id":"50854ca6-dc1b-40ea-bdd8-f4f10bef00c6","resolution":{"observed_at":"2026-08-14T04:54:04.996732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-14T04:54:04.925858Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.925858Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:539f768ca71e0ba8c6362ea5612ee721d2fe7ce315f654d4de5238ef4e7f7b45","observation_id":"e4fe2802-6e49-4871-832a-7b9a4b2a0c06","resolution":{"observed_at":"2026-08-14T04:54:04.925858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:04.928673Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.928673Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:31427220ef801d70a7c163b4579793185e39357bd03a2f3d727c7dc92f275c71","observation_id":"fb45ef34-65a3-454a-b256-64cdb27806fd","resolution":{"observed_at":"2026-08-14T04:54:04.928673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.114810Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":"7e268aa4-8833-4c08-a309-955135ef3f60","year":2004},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.931562Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:4d171e1a3a1df514cf8cbec948fc9b05a31f42bd41d9ad19f4bb67ae486b1c59","observation_id":"5d886f73-43a7-47a2-989e-5458d4517825","resolution":{"observed_at":"2026-08-14T04:54:05.118547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:04.934995Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.934995Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:c5da57ab0ee80c58b1241146ec183e699f8e04e13f626cde9b59e703aa64f64f","observation_id":"722bb495-bb34-483c-bc0c-0173a1f437db","resolution":{"observed_at":"2026-08-14T04:54:04.934995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:04.938567Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.938567Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:2ad3b4fbade519e39703f79df7001d9e92ca83eb2742e67effca284e6f53788d","observation_id":"345dc83a-bbf2-4980-ade6-8e25a1a14e70","resolution":{"observed_at":"2026-08-14T04:54:04.938567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.087604Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":"f140625d-83b2-4ebc-897b-2b7cd11d19f5","year":2005},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.942130Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:69553db0c96f949e584fd44cc8b29c2d688cd628d5079e7f142e5380e8bb8ee0","observation_id":"20f4a934-c6f5-4fb9-9660-c95de892fe5e","resolution":{"observed_at":"2026-08-14T04:54:05.091180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:54:05.076038Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"fd16194d-f5fb-427a-87eb-b4e2d3fa83ab","year":2016},"citing_paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:54:04.946058Z"},"links":{"citing_paper":"/paper/1909.02489"},"observation_digest":"sha256:a146128f39fc086713165ffd84b6b89784594eb58e8a4d54640e6b985fba1b85","observation_id":"829302c8-1ebf-4e60-851b-90769b770c6a","resolution":{"observed_at":"2026-08-14T04:54:05.079495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1909.02489","last_updated":"2019-09-05T15:41:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:46:29.551764Z","submitted_at":"2019-09-05T15:41:53Z","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:1909.02489."}