{"as_of":"2026-08-23T08:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:325af89f0bed38bafe3dfbf422f845e054746c1115916d793a3477d1944e788e","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:21:49.358294Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.09317/citation-record","integrity":"/paper/1908.09317/integrity","json":"/paper/1908.09317/citation-record.json","paper":"/paper/1908.09317"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.390587Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":"473943b2-abcb-447a-b7f5-e5d9ec994703","year":2016},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.050800Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:f965d66836c80f1df437330547477e3137508c66df137e93b40c3628876b54a6","observation_id":"7d68a81e-813b-4fc0-8937-6e11956cb70d","resolution":{"observed_at":"2026-08-14T11:21:50.395385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.376398Z","title":"Guided open vocabulary image captioning with constrained beam search","venue":null,"work_id":"eccfc0f9-985f-42c1-aa7b-6ab37d72924e","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.055957Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:dd13c693afe1dc2ea9b7eff8dab402471bb9823802972936694a3335799d0d21","observation_id":"5af452b7-3d16-462c-879f-85ce8327d493","resolution":{"observed_at":"2026-08-14T11:21:50.381155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.361347Z","title":"Partially-supervised image captioning","venue":null,"work_id":"fc549fe7-302a-402e-b597-6baf673d1fee","year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.060608Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:9e137256c74930b083df9467118be1bebf3b259a1305d2fd1d5a5a4a71afb11b","observation_id":"97bd61fd-f0ce-4a27-be01-0d1a96643300","resolution":{"observed_at":"2026-08-14T11:21:50.366747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.346203Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"10e8ff81-2d1f-43ed-963f-c3d58d8b1e3a","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.065362Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:f1e65d7bc1a72ab5edac74768191b5bd9fd75f1cd2b46476082dd8b625141a9b","observation_id":"cd622e6e-eb10-4e62-9da2-049a44506978","resolution":{"observed_at":"2026-08-14T11:21:50.351769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.332300Z","title":"Women also snowboard: Over- coming bias in captioning models","venue":null,"work_id":"17134b3b-9eb4-4eb7-815a-f7d41cab0810","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.069958Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:f6aaefb4ca2f1086dde336b839e3e9296cc92760075d1f39ff003b0051b46268","observation_id":"465e539e-eaee-4d12-b385-cb964f062c7c","resolution":{"observed_at":"2026-08-14T11:21:50.336902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.317988Z","title":"Deep compositional captioning: Describing novel ob- ject categories without paired training data","venue":null,"work_id":"21509b30-cb1e-450c-93bb-285aca79608b","year":2016},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.074636Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:33ac103e068190f30adaa1f66ff35423d6b3c3b5da3ee9de9c92d2909c5e6c8a","observation_id":"cd20f5a7-7f92-487b-9e7c-18306e0943e9","resolution":{"observed_at":"2026-08-14T11:21:50.323001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.303551Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"35e1406b-a3c7-4fb2-af7c-c367f6aed33e","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.079192Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:20df73c04d4834cc958336df85bb08534cbeb9cc3b4d4a6056519053fd6b7357","observation_id":"37608bf8-7d38-4074-bf61-dad8e8ef08f0","resolution":{"observed_at":"2026-08-14T11:21:50.308732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.289646Z","title":"Adversarial text generation via feature-mover’s distance","venue":null,"work_id":"8a076428-6840-4f74-b771-eb6bf032ac5b","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.084024Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:4d8aaa13141980c23804593559a63ab66bfbeca56043ae337cf23d5cd27ff665","observation_id":"f0696281-d196-425f-ae58-76177ceb549c","resolution":{"observed_at":"2026-08-14T11:21:50.294420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.275963Z","title":"Show, adapt and tell: Adversarial training of cross-domain image cap- tioner","venue":null,"work_id":"fa966918-7e3e-4c1b-89ae-d2646de87bb3","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.088273Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:4e80428680da1e4088498e06528a0154eea2623732439e0d3d7fe6710c661921","observation_id":"a6a209ca-8435-4475-8d61-c1b6eb3e5543","resolution":{"observed_at":"2026-08-14T11:21:50.280462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-08-15T13:36:27.756066Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-14T11:21:49.092525Z","title":"Learning phrase representations using RNN encoder-decoder for statistical machine translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.092525Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:7e91a486ef38be81c751f973593b8310ac14e99429cc63f77017bbc68fc0ce3a","observation_id":"37b91ab8-d4c5-4820-a2d9-9baf2e576db4","resolution":{"observed_at":"2026-08-14T11:21:49.092525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.261437Z","title":"To- wards diverse and natural image descriptions via a condi- tional GAN","venue":null,"work_id":"c1030406-59cc-4345-92f0-7a081d009554","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.097343Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:2553f0ccb2759d36082c1aeafd02c6008abe0d96596e872ee8e979e8752c142b","observation_id":"14fb92d0-7223-468e-b608-9afa051ee48e","resolution":{"observed_at":"2026-08-14T11:21:50.266341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.247641Z","title":"Visual dialog","venue":null,"work_id":"17051297-4cec-4659-bc49-c9c042732887","year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.102402Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:19ae1650b05e82b22ff775c43ea00378830de8c620a3856f245043a2c05b3994","observation_id":"a296666d-260e-4bad-a15c-60fbf54f8b2f","resolution":{"observed_at":"2026-08-14T11:21:50.251995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.233763Z","title":"Meteor universal: Lan- guage speciﬁc translation evaluation for any target language","venue":null,"work_id":"07fb721d-127e-4451-9970-f1bcda5e350c","year":2014},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.106878Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:72420a67bf3c394c71b2329bbaa214584013b5d58367bce2897fe1da517860a2","observation_id":"9b6c5ffe-db60-4622-ad3a-ac17afd8e0ba","resolution":{"observed_at":"2026-08-14T11:21:50.238471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.219936Z","title":"Long-term recurrent convolutional net- works for visual recognition and description","venue":null,"work_id":"6963a5ff-dfbe-47ed-ae58-aa957bcb89c6","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.111212Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:1774cf1acc7f059c7fb704bb7c489ad8fc0a8f67b6d63952a7607d8305535a31","observation_id":"96ddcc7f-eeb6-4429-9539-e8ece88393e6","resolution":{"observed_at":"2026-08-14T11:21:50.224589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.09782","last_updated":"2017-04-03T20:34:36Z","snapshot_observed_at":"2026-08-15T15:21:59.634307Z","submitted_at":"2016-05-31T19:37:29Z","title":"Adversarial Feature Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.09782","snapshot_observed_at":"2026-08-14T11:21:49.115213Z","title":"Ad- versarial feature learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.115213Z"},"links":{"cited_paper":"/paper/1605.09782","citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:ac5bcdcdce935a58a9e72a80dd405901bb40e3cdf7d4e2ef8ba1f24209af5cc1","observation_id":"174b51ff-a2df-4233-a99e-92a9490c6535","resolution":{"observed_at":"2026-08-14T11:21:49.115213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-08-14T20:46:56.185352Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-14T11:21:49.119851Z","title":"VSE++: Improving visual-semantic embeddings with hard negatives","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.119851Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:4399026a601006578ca0a61415bcd6a904039695e87a25fa21176e4b3f2b0260","observation_id":"d557ae01-89a5-4f1c-8b2f-3ea5e75fa703","resolution":{"observed_at":"2026-08-14T11:21:49.119851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.204530Z","title":"From captions to vi- sual concepts and back","venue":null,"work_id":"767072c4-083c-41e5-9217-787e0dfe4f2d","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.124345Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:f008fc47952e9f181bfbb7960c46ee9637ed2fb399663b6d5b5395f10ae677d0","observation_id":"aea4e3e0-1b75-4341-b3a1-40ca4affc4dc","resolution":{"observed_at":"2026-08-14T11:21:50.209802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10787","last_updated":"2019-04-06T10:57:25Z","snapshot_observed_at":"2026-08-17T15:00:20.802236Z","submitted_at":"2018-11-27T03:16:20Z","title":"Unsupervised Image Captioning","version":2},"cited_work":{"arxiv_id":"1811.10787","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.10787","snapshot_observed_at":"2026-08-14T11:21:49.459364Z","title":"Unsupervised Image Captioning","venue":"cs.CV","work_id":"cae38abd-94c8-4d60-ae54-14e2d3f5267c","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.128637Z"},"links":{"cited_paper":"/paper/1811.10787","citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:b0c8a5aba795348c3cc52f1a1fd4bc9bc4952f504212ac0b50ec1325b48166dd","observation_id":"4866dddf-2f31-4059-b0bd-2177e7d0a151","resolution":{"observed_at":"2026-08-14T11:21:49.464577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.189601Z","title":"StyleNet: Generating attractive visual captions with styles","venue":null,"work_id":"a6f09d3e-1c19-4c29-945c-d43815d7ce19","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.133156Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:005be8593cad472735319b26f200017073d957f6581edcd6900e8c940e000958","observation_id":"79f3acfb-a3a4-4087-bf21-c112bc25ec89","resolution":{"observed_at":"2026-08-14T11:21:50.194138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.175028Z","title":"Un- paired image captioning by language pivoting","venue":null,"work_id":"ca8fa973-ff6c-45c9-883e-ff56be75269b","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.138236Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:26660911b72a6f3b99c7431eaccf0723c5c24f947e8b6be4acb8345403664540","observation_id":"ce139965-5b8c-46f6-ad4e-724719239783","resolution":{"observed_at":"2026-08-14T11:21:50.179739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.160850Z","title":"Improved training of wasserstein gans","venue":null,"work_id":"32a19d00-1372-49b1-b28c-b86eb04b585a","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.142747Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:dcaff86c19949a7ea115a149605680f3950f81628cac810ef6b85a1533a29137","observation_id":"5487240a-7548-4ed3-9600-ac34efdb04ac","resolution":{"observed_at":"2026-08-14T11:21:50.165547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.145485Z","title":"MSCap: Multi-style image captioning with un- paired stylized text","venue":null,"work_id":"bd00ac54-26bf-4b7e-a873-7f9c182b962e","year":2019},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.147579Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:9e742a27c10e82ece27f228fd26dba2e5fd7fbe29e019eba520b64bbb337dec9","observation_id":"711de645-aeae-4efe-b938-683a37a07f0c","resolution":{"observed_at":"2026-08-14T11:21:50.151076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.129398Z","title":"VizWiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"cc3b46ae-0320-4c90-8341-57d750e31c1e","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.151969Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:25be3f6c2faed304c73a5e9b1ee216b3f3a68a7f0485283e6dca9f718cf3f47d","observation_id":"7d9848f4-4871-4f17-aedb-d955dd1e28a6","resolution":{"observed_at":"2026-08-14T11:21:50.134384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.156222Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.156222Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:b6bc5a79f63a875499794aec7b46f4456d50bb8156c3d33d29f65a6842fb0fb1","observation_id":"f1255e8a-a030-44fd-bf18-fc2e7ac68918","resolution":{"observed_at":"2026-08-14T11:21:49.156222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.104736Z","title":"Speed/accuracy trade-offs for modern convolutional object detectors","venue":null,"work_id":"ec6a63c4-7760-46e0-8892-3d4735ffb63e","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.160518Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:1ba3859442636f920972492a3674af5b1023665d962296e947a7bebd26ae1e5d","observation_id":"f7e9902d-867a-47e4-acbc-3be5f12ab9bd","resolution":{"observed_at":"2026-08-14T11:21:50.109732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.089939Z","title":"DenseCap: Fully convolutional localization networks for dense caption- ing","venue":null,"work_id":"22f5338e-57d1-40ab-bb28-ba83053d80ef","year":2016},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.164737Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:6e1d786ee196bd071162a1b5b816b7625785a78654dc6f75a91b3dc9d151319a","observation_id":"7412c2ab-6660-4bc3-b97e-1cbfe57af8b9","resolution":{"observed_at":"2026-08-14T11:21:50.094595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.075513Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"a409131e-6013-4202-bd18-680def3fd8e9","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.168914Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:95eebc37c14ded0cff315e6b9a0970d907ce59901cecff0aea799f63acaa63d5","observation_id":"13c9505c-4874-4445-b13b-17d8a512eed3","resolution":{"observed_at":"2026-08-14T11:21:50.080284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T11:21:49.173388Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.173388Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:26ad83978ff42e7e2f6c8903d2bf9389d9d74a6ac31b03742ba0d26ca340b92d","observation_id":"e921cc49-5e6e-4c28-bfa2-e04e0d2a58bd","resolution":{"observed_at":"2026-08-14T11:21:49.173388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-08-14T23:12:14.296355Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-08-14T11:21:49.177786Z","title":"Unifying visual-semantic embeddings with multimodal neu- ral language models","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.177786Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:e24826ab0144ee9a4c795e927abf843b49fa3335d473b94f13d56de266f294d8","observation_id":"7256ea6d-0897-4078-a360-1a693a8a1913","resolution":{"observed_at":"2026-08-14T11:21:49.177786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.060577Z","title":"OpenImages: A public dataset for large-scale multi-label and multi-class image classiﬁcation","venue":null,"work_id":"01dc6b74-8add-41fb-9907-4a12d9e509d9","year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.182853Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:2e2537da20dd527bf6fbd70ff056ea6e26902a41befe56e9326cc956cee9390d","observation_id":"edbb9db4-cad3-4413-ad80-ab692e553d16","resolution":{"observed_at":"2026-08-14T11:21:50.065623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.045380Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"2f39f2c1-884d-4fc2-9866-6cdbb4fff9c6","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.187321Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:c0609462f290a054dbb391af866c9dcbd869fafd88d7f1d19360d76b8f49f4cc","observation_id":"140f1fa0-6291-4298-aac8-482c66e61aae","resolution":{"observed_at":"2026-08-14T11:21:50.050852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.030451Z","title":"From word embeddings to document distances","venue":null,"work_id":"dbdb0818-c624-402b-8c6e-6e5f9f44ff6c","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.191699Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:9ee280a8302727b2f9946545de68f4030452b9cd01f04b125cd3dfd87cdd3b81","observation_id":"71e19b4c-db59-4d3a-8318-29c1d03ef217","resolution":{"observed_at":"2026-08-14T11:21:50.035102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00982","last_updated":"2020-02-21T15:15:33Z","snapshot_observed_at":"2026-08-20T08:25:11.093701Z","submitted_at":"2018-11-02T16:58:28Z","title":"The Open Images Dataset V4: Unified image classification, object detection, and visual relationship detection at scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00982","snapshot_observed_at":"2026-08-14T11:21:49.195941Z","title":"The open images dataset v4: Uniﬁed image classiﬁcation, object detection, and visual relationship detection at scale","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.195941Z"},"links":{"cited_paper":"/paper/1811.00982","citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:696ff0c3a27f9a1c9143113f0a9125eba5ca1670a6f6f09f252f2b43f16ddb4b","observation_id":"e639d1fd-85ff-4d48-91aa-73dce18fb0a8","resolution":{"observed_at":"2026-08-14T11:21:49.195941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:50.014201Z","title":"Unsupervised machine translation using monolingual corpora only","venue":null,"work_id":"933661ec-f18e-4ee4-89d3-f73a5f317eca","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.200592Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:f8c38cacceeaeae615c4c79f219bfa6262aff22e06f18a88c54862036dd41acf","observation_id":"3547e4ff-82bd-4d82-913a-d8777c58e2ce","resolution":{"observed_at":"2026-08-14T11:21:50.019131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.999005Z","title":"Phrase-based & neural unsupervised machine translation","venue":null,"work_id":"866f49f5-dd97-459a-acba-4f7800fe351d","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.204978Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:e38af9d0296eb4b0e03cb01b4697d32e2bdb7b271a6ad0219311ef46c35283a8","observation_id":"87046abb-bc66-47a2-ad59-99ee07ee2c10","resolution":{"observed_at":"2026-08-14T11:21:50.003670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00861","last_updated":"2019-03-10T07:01:55Z","snapshot_observed_at":"2026-08-14T19:29:50.604736Z","submitted_at":"2018-04-03T08:06:33Z","title":"Generating Diverse and Accurate Visual Captions by Comparative Adversarial Learning","version":3},"cited_work":{"arxiv_id":"1804.00861","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.00861","snapshot_observed_at":"2026-08-14T11:21:49.393438Z","title":"Generating Diverse and Accurate Visual Captions by Comparative Adversarial Learning","venue":"cs.CV","work_id":"c1b7fed1-842f-4476-9784-b86cd906a1c5","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.209513Z"},"links":{"cited_paper":"/paper/1804.00861","citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:e7f87fcde5eb91b654f950d6208c60320e3aaa1451fc6469d25d40f2a4a358a5","observation_id":"75b16d00-50a4-4480-94a6-2fd4d930ec3a","resolution":{"observed_at":"2026-08-14T11:21:49.400024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.984462Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"0ce2d1c6-2c1a-4aaf-98ef-ee1a1e815802","year":2004},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.214205Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:d9a9953da3bcdcb58fbd8c38fae2cfcae5cb36e4b52c62f719030f31ccd19753","observation_id":"1966479c-1b24-4bb0-9faf-d738c6c39e50","resolution":{"observed_at":"2026-08-14T11:21:49.989330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.968874Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"058afc15-f970-413a-b539-1909d56dda76","year":2014},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.218844Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:6e5901beb3be63ce46453d981acf195162e8cbb496debcfa004e013e6fd5d5e3","observation_id":"11b42c84-79c1-4e7b-ac00-ae6e040add50","resolution":{"observed_at":"2026-08-14T11:21:49.974238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.954185Z","title":"Teaching machines to describe images via natural language feedback","venue":null,"work_id":"e7cf7c34-f04d-4bb0-99d2-525342eb688a","year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.223234Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:54df04a38956a16b5cbb1fd00b2aaae65c0834c3dfe1a25b3e185d867b10a980","observation_id":"d0480356-7346-47b4-9fcf-19c9de0e11dc","resolution":{"observed_at":"2026-08-14T11:21:49.958902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.228016Z","title":"Improved image captioning via policy gra- dient optimization of spider","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.228016Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:27e6b75219d28cd3737d48c89876f86a224902a08b19b4ca37bbf0e86ecd6f38","observation_id":"5b174ceb-e1e2-44d7-bef1-d72524f35b61","resolution":{"observed_at":"2026-08-14T11:21:49.228016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.232199Z","title":"Knowing when to look: Adaptive attention via a visual sen- tinel for image captioning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.232199Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:c16d4f865f2a5834577415f2d575d4e7a5c228e115056173ed7a8019f5f6a7c4","observation_id":"a4a589ba-ea53-45d1-b4cd-00b88a060639","resolution":{"observed_at":"2026-08-14T11:21:49.232199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.921016Z","title":"Neural baby talk","venue":null,"work_id":"fc80b221-ee0a-41eb-9909-37486f63f526","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.236314Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:b8c2f084ce2d72108700d52406f2c23c1161fb6ccc3f95a1ed1f2b0791889305","observation_id":"5297d2d2-0ce3-4cd1-a37d-29822afa472b","resolution":{"observed_at":"2026-08-14T11:21:49.925602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.906230Z","title":"Visualizing data using t-SNE","venue":null,"work_id":"e2085c57-7a90-478e-8159-cc545892f3ab","year":2008},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.240435Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:96939dd8862f5c4b9a569965ae9c88eb889aef8f41ddbff8240bc3a45876653c","observation_id":"4646014e-da54-4b69-b8b8-d63ddf7abc43","resolution":{"observed_at":"2026-08-14T11:21:49.911058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.892194Z","title":"The stan- ford CoreNLP natural language processing toolkit","venue":null,"work_id":"4167f24f-e29a-4801-81ac-358cb4b54996","year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.245049Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:b63c1b7b2c8c0b8f1d1726d749d3894d6cc68ef260f7c2005fbe69b5e01d445c","observation_id":"61847bfc-ef07-40d7-99c1-324254d67622","resolution":{"observed_at":"2026-08-14T11:21:49.896734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.878434Z","title":"Learning like a child: Fast novel visual concept learning from sentence descriptions of images","venue":null,"work_id":"d3fe1c8c-ebcf-40bc-a0e4-d99080932ba8","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.249691Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:f3eedbe52cea75bf04cbad0830c53550e25cb0a8591f162fc4e958a12ca4ac4b","observation_id":"c8eec48e-6ba1-4a5d-ad17-e8f0b04ea120","resolution":{"observed_at":"2026-08-14T11:21:49.883100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.863468Z","title":"Sem- Style: Learning to generate stylised image captions using unaligned text","venue":null,"work_id":"54035f17-7249-4e1f-9056-cb1b5545a426","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.253865Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:43ed3bd123387b6c5f5310bdffef4f64afa7370c4f067ad4e4faa95ab50306b8","observation_id":"caaacc1c-8c40-455b-8dde-0f7985c42798","resolution":{"observed_at":"2026-08-14T11:21:49.868624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.848989Z","title":"Jointly modeling embedding and translation to bridge video and language","venue":null,"work_id":"87aaf62a-f0e0-4ba8-adaf-c23b82456437","year":2016},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.257982Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:3c0ae04e63adf3bb753d595f2c0a61cb534847332e7ea26931355a8977160ada","observation_id":"081451b6-48d3-42cd-8ff9-c1a9c6202780","resolution":{"observed_at":"2026-08-14T11:21:49.853953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.834880Z","title":"GloVe: Global vectors for word representation","venue":null,"work_id":"5f0d399b-512f-4186-bc5c-5bf86d4adf14","year":2014},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.262233Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:d2ac923a1e1a0f73072fbd8db9f08d484dadf823e1d7355fc7d399f7de0e779c","observation_id":"210a1364-a49a-4038-a1dd-46f43fbb0cb8","resolution":{"observed_at":"2026-08-14T11:21:49.839595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.820848Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"976f21bc-b59c-46a0-9973-93cdd138c6b0","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.267346Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:19e478e387c6e3bdd262bead3e0ef28315340fcd73bc7bf7b5372196b4c05084","observation_id":"9d83399a-4384-45d3-8d09-8f5d91b25f1f","resolution":{"observed_at":"2026-08-14T11:21:49.825483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.806411Z","title":"Self-critical sequence training for image captioning","venue":null,"work_id":"64c55826-56cb-4229-9b71-c517592ee1d2","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.271747Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:6321ed007016f1dd47db6fadf10ad8f1ac11bc11fff7ff61f44565bef7f79da1","observation_id":"b2437259-aa6f-40e0-a48e-16a13e1e9d77","resolution":{"observed_at":"2026-08-14T11:21:49.810801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.791327Z","title":"ImageNet large scale visual recognition challenge","venue":null,"work_id":"dfb3d574-ad1c-4d76-bd31-e73d664dbee5","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.276815Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:891c7ee8243b89245bc343034cef75ddc1e2a1406ea5046e0e57f54cba1ffb7c","observation_id":"08d40f3f-c859-47e4-af41-b5c0fd0e97c8","resolution":{"observed_at":"2026-08-14T11:21:49.796526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.775702Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"41f88ef2-8d23-4304-9c0f-2434fc27629e","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.281797Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:c5c9f668d680f8d00726c985682d76a0133e7bfd113a30082dc28c7dae9b770e","observation_id":"0fd873de-d811-4278-bf7c-5eb2202282fb","resolution":{"observed_at":"2026-08-14T11:21:49.781359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.760072Z","title":"Speaking the same language: Matching machine to human captions by adversarial train- ing","venue":null,"work_id":"e4cf7f67-c646-42fe-a803-151e13098f27","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.286027Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:266eeb1c5b597e7ab1915eac0609892f979aaa9340318fba227e75b058f3356d","observation_id":"8d405e70-3988-446d-8598-da7516652da1","resolution":{"observed_at":"2026-08-14T11:21:49.764925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.745711Z","title":"Deforming autoencoders: Unsupervised disentangling of shape and ap- pearance","venue":null,"work_id":"b1092e18-313e-4180-9fbf-b5f23aa86ab0","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.290120Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:7c7b508daedb089508e50e2cbae5069ee29c776ceb6e58d39db84078d8dcf90f","observation_id":"21de770f-2a64-44db-be90-6b321b68c7ea","resolution":{"observed_at":"2026-08-14T11:21:49.750435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.731777Z","title":"Engaging image captioning via per- sonality","venue":null,"work_id":"a7677d93-a986-45de-b72e-f5e20a8893d5","year":null},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.294410Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:6a333f8bfeed516d662aa0ca771303fe9e57217aaa5a07dacebde3a286f93274","observation_id":"24d7acb7-651e-404a-b054-6fb0e294b2af","resolution":{"observed_at":"2026-08-14T11:21:49.736319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.717265Z","title":"Towards text generation with adversarially learned neural outlines","venue":null,"work_id":"f5ec6bad-3478-40f2-8b94-dfbb7cac4295","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.298686Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:b9614a3c6e4bee088f30550a0e6645b60833f0a6996e26c01536828b4ec1bab3","observation_id":"eb488959-56e3-4534-83f7-3e5b4a2a5dcc","resolution":{"observed_at":"2026-08-14T11:21:49.722240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.703317Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":"ec9ca32b-024e-48e6-a9a8-15006816a34e","year":2014},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.303007Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:da912a434552e03dc23cf0286b39a335d0d1959548a1b9fe4b993e38128592f0","observation_id":"3b62f948-9c4f-425c-87a7-e44dc90b407d","resolution":{"observed_at":"2026-08-14T11:21:49.707847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.307627Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.307627Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:f4df4962961ba1e3571819d3f54edb10961dc1e73f5e3a08da41fe649a8e6711","observation_id":"2ca248f7-0463-4f3b-be81-6aca77e5b0f4","resolution":{"observed_at":"2026-08-14T11:21:49.307627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.679518Z","title":"Captioning images with diverse objects","venue":null,"work_id":"f1095794-1f0f-48f3-9bdb-66ca01c172d0","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.311808Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:1a3a695c9c23dbadcf385be234206f2e5f543e4407fbd1fbe142e6e1b1959ec6","observation_id":"1e69ab5a-de3b-4ad6-abcc-de758b06f2a1","resolution":{"observed_at":"2026-08-14T11:21:49.684154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.665223Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"e178b12c-4917-4972-bba1-3bb6e921e293","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.316206Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:c91be30f2803f8ba653fe79283b53b0eb8626f1d09a2d6dc4021d96cd21718fe","observation_id":"add7915b-047b-4bb5-9fb3-b86bc1d53de2","resolution":{"observed_at":"2026-08-14T11:21:49.669643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.651147Z","title":"Diverse and accurate image description using a variational auto-encoder with an additive gaussian encoding space","venue":null,"work_id":"1839878f-1731-4e9b-8012-8e79c64e368d","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.320325Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:8aaa7596143cbba1ade51539269da4e3cfb4cc1f6e7b09bb649632201d6069c0","observation_id":"aba98efa-5dc5-4e67-ac51-3ba198649935","resolution":{"observed_at":"2026-08-14T11:21:49.655861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.636289Z","title":"Automatic alt-text: Computer-generated image de- scriptions for blind users on a social network service","venue":null,"work_id":"225d656a-c452-43a6-bf17-4d654a69e2f0","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.324482Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:0f22524eaa0fb95e7938b6056ab739a30fb83460509af26c62abb226a2f09803","observation_id":"f563f42d-6c22-4729-a433-657eb34d8d69","resolution":{"observed_at":"2026-08-14T11:21:49.641250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.621878Z","title":"Show, attend and tell: Neural image caption gen- eration with visual attention","venue":null,"work_id":"8d62840d-7788-456a-96cd-1bbbc1915aef","year":2015},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.328768Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:dea70761a3cebfb089266c4c2bb30e7bbcbf1ef824994c340a691e62e1fddaea","observation_id":"ae702d51-7242-4aeb-a8c3-04d1e674e811","resolution":{"observed_at":"2026-08-14T11:21:49.626520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.607769Z","title":"Review networks for caption gen- eration","venue":null,"work_id":"f32ed800-8f53-49ae-86dc-d83325f0780f","year":2016},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.332844Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:7df6cff2326f476dd08c7789c8fb97ed6f420d9d9b7ce606592a96edd2980649","observation_id":"3672b3b3-97c3-459d-8afe-c45b03a8cb18","resolution":{"observed_at":"2026-08-14T11:21:49.612477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.591578Z","title":"Incorpo- rating copying mechanism in image captioning for learn- ing novel objects","venue":null,"work_id":"375879d2-8024-4649-87ec-a5d764fc7c2e","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.337040Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:220035f18df7ce03c56808bc499aaa4413d7dfe48ca905b76142b62044fbb967","observation_id":"0f0f9291-e594-40ce-a1ad-0e53b8936924","resolution":{"observed_at":"2026-08-14T11:21:49.597659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.575361Z","title":"Explor- ing visual relationship for image captioning","venue":null,"work_id":"32151a08-2615-4499-97b9-352fe4cf0ba7","year":2018},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.341293Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:a776bf7c270ba6f8e6d36fe4f7491f701716a8cad857a5dda12ff689589a2bae","observation_id":"d2256260-1f4b-4f0b-ac04-a156ac8daaca","resolution":{"observed_at":"2026-08-14T11:21:49.580762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.560852Z","title":"Boosting image captioning with attributes","venue":null,"work_id":"e7162655-1cf4-47c5-80fb-62ab8498efb1","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.345606Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:4f89b4fb2180dd81dc247b4dbb1ee295b36c09e7e1bfddeb8048e9a62bee4221","observation_id":"fcb4a1cd-f968-4957-9b8c-652f58199050","resolution":{"observed_at":"2026-08-14T11:21:49.565477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.546311Z","title":"Image captioning with semantic attention","venue":null,"work_id":"e1935d68-b66d-4751-bbfa-c9298217a18e","year":2016},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.349967Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:3e31636f1ae0eb0a75deca3f0a33dc7344985379cad2c5965f79baefe36b1784","observation_id":"0aee144c-dc01-4e1f-a6ad-c9d1b1f0af0d","resolution":{"observed_at":"2026-08-14T11:21:49.550752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.531814Z","title":"Dual learning for cross-domain image captioning","venue":null,"work_id":"020da6ec-9156-475a-9719-45b0c85b7099","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.354148Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:cbdd8406cac2103f0550e93c47dca918ad1345af92ce72b6de1bac207bef57d1","observation_id":"168df444-f91c-4e67-b062-2d06e4af929c","resolution":{"observed_at":"2026-08-14T11:21:49.536687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:21:49.517364Z","title":"Unpaired image-to-image translation using cycle- consistent adversarial networks","venue":null,"work_id":"934ab4a2-c055-48d2-9548-94afb01a0af2","year":2017},"citing_paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T11:21:49.358294Z"},"links":{"citing_paper":"/paper/1908.09317"},"observation_digest":"sha256:9fa04cd7cb333e29ac2922b6ef2f3b21dca0c804dde02f06d4417eb68d9bf131","observation_id":"51603e1c-a047-49ea-af49-27d042c7c6c5","resolution":{"observed_at":"2026-08-14T11:21:49.522176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.09317","last_updated":"2019-08-25T12:56:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:12:16.113176Z","submitted_at":"2019-08-25T12:56:41Z","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":58},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:1908.09317."}