{"as_of":"2026-08-15T17:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e947a0bdb77a9d67904d9e2accb1ab85712a9c7aab34972c1eadeb44d8b24ea","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:36:11.326499Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11836/citation-record","integrity":"/paper/2412.11836/integrity","json":"/paper/2412.11836/citation-record.json","paper":"/paper/2412.11836"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.669168Z","title":"Bottom -up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":"8cbf35f4-ee93-48c7-9529-01836df77cab","year":2018},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.830605Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:2640a79a7b62a24f13d4d38d15d1de0e29ca3c573ccd7f121c079f2db71c2821","observation_id":"5dcf5570-694a-4036-b6d5-5615c9cdee6d","resolution":{"observed_at":"2026-08-11T14:36:12.675214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.652154Z","title":"Entangled transformer for image captioning,","venue":null,"work_id":"cc8927e8-1e1c-4493-97fa-a93e098de712","year":2019},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.836912Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:4150d60a24e4e771672baa6c336e1f1ee0cd63692243ea4d1e74a9f9ef05a3ca","observation_id":"33740153-13c8-4e31-874f-f34eac01de6c","resolution":{"observed_at":"2026-08-11T14:36:12.657153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.636814Z","title":"Automatic alt -text: Computer-generated image descriptions for blind users on a social network service,","venue":null,"work_id":"1290b3e9-7ea7-4cd3-a292-bd5089adc2bd","year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.842187Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:a0545002915b935c2f4ddf710bf5b449d9290d9a2c6c582991c46c04744de78a","observation_id":"73756992-8194-44f4-a512-386375f61be3","resolution":{"observed_at":"2026-08-11T14:36:12.641821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.620158Z","title":"Vizwiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":"3fe41686-c60e-4302-9bde-3636cfbcc268","year":2018},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.847943Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:db09949f9e3cbe7c99e1c49ac18744fc94297812cb28b157a57398d425855842","observation_id":"ced5a1ab-4368-433e-aec3-ac86a62ceae0","resolution":{"observed_at":"2026-08-11T14:36:12.625214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.603963Z","title":"VQA: Visual question answering,","venue":null,"work_id":"1a47f405-5022-4148-982e-d71302ea4f09","year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.853726Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:664ec27407f5c0f47d0e5f2b182adbe7575cbce99caed089bc68a29361884b3e","observation_id":"e84212a4-f758-4a50-8066-a480211d8b1a","resolution":{"observed_at":"2026-08-11T14:36:12.608995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05594","last_updated":"2017-04-12T05:48:44Z","snapshot_observed_at":"2026-08-14T21:30:00.020339Z","submitted_at":"2016-11-17T07:39:46Z","title":"SCA-CNN: Spatial and Channel-wise Attention in Convolutional Networks for Image Captioning","version":2},"cited_work":{"arxiv_id":"1611.05594","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05594","snapshot_observed_at":"2026-08-11T14:36:11.685037Z","title":"SCA-CNN: Spatial and Channel-wise Attention in Convolutional Networks for Image Captioning","venue":"cs.CV","work_id":"3b08df98-a50f-46cb-9f58-d57e951d663d","year":2016},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.859627Z"},"links":{"cited_paper":"/paper/1611.05594","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:52869493a9be32863552bfc03b798fc677f317e4cb1be55ff46b8fba29d2b96c","observation_id":"6ef1c2ca-6847-4cfb-aab5-110a52965764","resolution":{"observed_at":"2026-08-11T14:36:11.693828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.587807Z","title":"Image captioning using DenseNet network and adaptive attention,","venue":null,"work_id":"3ef0f48c-496a-4133-b76d-189500b35bf6","year":2020},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.866084Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:5b96e9fb98c433284952d8da0a83b4cf49afe0a193da096ca427eebef83d8444","observation_id":"7b8fdcae-c1bc-4df8-bd3d-62c7cd817a29","resolution":{"observed_at":"2026-08-11T14:36:12.593011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.570520Z","title":"High-Order Interaction Learning for Image Captioning,","venue":null,"work_id":"73d31c7e-694e-4392-b2f4-6b85f72c51bb","year":2021},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.871021Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:1ba860e386949eac256d337596172b66f042fa8d87964db95992fa939c45a291","observation_id":"406f6488-6303-497d-ba87-9d154d94274a","resolution":{"observed_at":"2026-08-11T14:36:12.575319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.554016Z","title":"Stylenet: Generating attractive visual captions with styles,","venue":null,"work_id":"c4272a05-79f0-47c9-8fe7-f8d83fa523ac","year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.876203Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:b29f307888a621319eb82f9e41391cb180873bba1b67519b1b7ae94c81b10bbc","observation_id":"73381eec-3e93-40bb-b050-0e0da7c19983","resolution":{"observed_at":"2026-08-11T14:36:12.559263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.536820Z","title":"Similar Scenes arouse Similar Emotions: Parallel Data Augmentation for Stylized Image Captioning,","venue":null,"work_id":"f9d342d7-3024-4d40-8148-8f908b37f562","year":2021},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.881597Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:be3c3458d6e2e0e2d952465b7f9add2daf41cf6941e21d00103a41bd531a656b","observation_id":"76aeddb8-c4bb-4af0-9c11-cefcc9a24299","resolution":{"observed_at":"2026-08-11T14:36:12.542168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.520706Z","title":"“Factual","venue":null,"work_id":"a940d495-2d99-4b73-927f-de989c366720","year":2018},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.886556Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:dd769c1fad1a835e1b11efac48dd8783087741d98cd97d259cde831694d8ac69","observation_id":"b933ddea-0d31-4893-a4ea-7d8c0d89f4ef","resolution":{"observed_at":"2026-08-11T14:36:12.525606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.504704Z","title":"MSap: Multi -Style Image Captioning With Unpaired Stylized Text,","venue":null,"work_id":"75bffb71-5ae3-4a1f-b71f-040b002559f7","year":2019},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.891808Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:684fe017d3578750049ce64423d68e0ee96d4aa1c2673ab17ac623739f2792cd","observation_id":"0475a42e-e94d-42c9-a58e-4b4f914bae1b","resolution":{"observed_at":"2026-08-11T14:36:12.509646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.488059Z","title":"SummaRuNNer: A Recurrent Neural Network based Sequence Model for Extractive Summarization of Documents,","venue":null,"work_id":"f1de17cb-d57f-46ac-baa6-b27a24291646","year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.896661Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:1e0e3cd0df6eb073452b0961a38d0ab005bc33166f0b0091126554eec0b62537","observation_id":"754592c0-fa9b-45cb-a784-480c6f4b1ead","resolution":{"observed_at":"2026-08-11T14:36:12.493489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.06023","last_updated":"2016-08-26T16:13:13Z","snapshot_observed_at":"2026-08-14T22:09:41.573524Z","submitted_at":"2016-02-19T02:04:18Z","title":"Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.06023","snapshot_observed_at":"2026-08-11T14:36:10.901271Z","title":"Abstractive text summarization using sequence-tosequence rnns and beyond,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.901271Z"},"links":{"cited_paper":"/paper/1602.06023","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:07e0bfd48c1875802ce8398a21ec08db33d4c9a2ec3e89afbffae96fe7f013e7","observation_id":"0559f682-77f9-45f5-8379-ff86f584968e","resolution":{"observed_at":"2026-08-11T14:36:10.901271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.468999Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions,","venue":null,"work_id":"56229094-e751-4c7b-af89-233923bdaea8","year":2014},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.906245Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:5ae17bf6646f0633b46debcb06f12de15cb5eb932ae47137595e78aeef6c4b06","observation_id":"41e1617a-e91b-45ba-be05-de0e16934956","resolution":{"observed_at":"2026-08-11T14:36:12.474347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.453661Z","title":"Corpus -guided sentence generation of natural images,","venue":null,"work_id":"bc2ba292-6e0d-4595-a149-58e07de6f1db","year":2011},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.910978Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:84dcf3185e4643b07f1b67d660cdb2b272dcaeb2e8b772bd29c80ebba4511518","observation_id":"ab859f51-3b72-4e25-954d-5c04434c4879","resolution":{"observed_at":"2026-08-11T14:36:12.458659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.431261Z","title":"Generating image descriptions from computer vision detections,","venue":null,"work_id":"dc255ee0-6b79-47c8-bb47-0a688fd36cb2","year":2012},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.915569Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:798ec6872c821fffa4cac7eb9d514a2a40388ee7aa05468db6ef9aeb585108aa","observation_id":"1fd48cea-baf8-45c0-ad6d-90b16d55aef4","resolution":{"observed_at":"2026-08-11T14:36:12.437163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.413571Z","title":"Every picture tells a story: Generating sentences from images,","venue":null,"work_id":"cd3bcb54-c594-44d8-b54d-70f1445a3d52","year":2010},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.920115Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:c9005dff0150d09ebd96594bd82ac8dd5deb0c79cc0f2d16139872cf153a5db5","observation_id":"5ea2c62a-ba3b-4d27-8f7a-483bdaacc863","resolution":{"observed_at":"2026-08-11T14:36:12.418966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.395787Z","title":"Framing image description as a ranking task: Data, models and evaluation metrics,","venue":null,"work_id":"f2a87c45-cba3-40ea-9141-f75b4bda9b9e","year":2013},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.924698Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:10ff80bba0493cd81a8870150a163df930cdf8c7b6dca669d3d88202d586f528","observation_id":"d9800e96-5bc3-463b-81fa-6af29f13f755","resolution":{"observed_at":"2026-08-11T14:36:12.401366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6632","last_updated":"2015-06-11T15:26:58Z","snapshot_observed_at":"2026-08-15T10:22:07.704120Z","submitted_at":"2014-12-20T08:10:04Z","title":"Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)","version":5},"cited_work":{"arxiv_id":"1412.6632","doi":null,"metadata_source":"pith","pith_arxiv_id":"1412.6632","snapshot_observed_at":"2026-08-11T14:36:11.630441Z","title":"Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)","venue":"cs.CV","work_id":"be829a00-8577-4699-996b-4d6eef1fa759","year":2014},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.929525Z"},"links":{"cited_paper":"/paper/1412.6632","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:15330f6308cf6e6fba3edfb72bbbe2066ed7069594a1e38e32e772f7c00dd0c6","observation_id":"b7a817f2-0297-4ab8-9bf8-0519ec504459","resolution":{"observed_at":"2026-08-11T14:36:11.637073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.376863Z","title":"Show and Tell: A Neural Image Caption Generator,","venue":null,"work_id":"c6ddbc6b-e647-4ac2-87d7-dfafdd7dbc0b","year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.935288Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:86d287c3c9713fc5af0abd35b2892eeaee60282875a5fa7ba885a56102d9aa81","observation_id":"9c432f49-8056-4a10-a98f-115817353b86","resolution":{"observed_at":"2026-08-11T14:36:12.383317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.358725Z","title":"Guiding the long -short term memory model for image caption generation,","venue":null,"work_id":"6595f6e6-f5f1-4111-8879-ff592eefd532","year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.941162Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:57eac97aaa925ba719e16fd8a43986413356ce2a5fdae537099241495fd1527d","observation_id":"7e7d3542-c492-42d8-ba3a-2c7bd26e8ca3","resolution":{"observed_at":"2026-08-11T14:36:12.365444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.342159Z","title":"Long-Term Recurrent Convolutional Networks for Visual Recognition and Description,","venue":null,"work_id":"b6080979-3776-4f48-9249-d33edc01d936","year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.945752Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:1b2b060dc07b6dd9884a4cdf83498247b1e85252930de298ab725427692b672e","observation_id":"8b686616-17d0-4ce0-9fe2-603bd47c2106","resolution":{"observed_at":"2026-08-11T14:36:12.347317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.324117Z","title":"Image Captioning with Deep Bidirectional LSTMs,","venue":null,"work_id":"1e327bb9-86c9-4bef-bb23-b66a40925c8e","year":2018},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.950396Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:4a778618ab6f5b070dc4618501feccc258426ee08543d16d9320e2d044cc19a6","observation_id":"82b70d48-3428-46fb-b820-62c3ac98ef5a","resolution":{"observed_at":"2026-08-11T14:36:12.330872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01887","last_updated":"2017-06-06T06:59:15Z","snapshot_observed_at":"2026-08-14T21:26:51.773547Z","submitted_at":"2016-12-06T16:03:50Z","title":"Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01887","snapshot_observed_at":"2026-08-11T14:36:10.955397Z","title":"Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.955397Z"},"links":{"cited_paper":"/paper/1612.01887","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:a729f721a01c7d6700fd883bddfab89726beaba02297531b7f231ab99a583771","observation_id":"5385956a-552c-4749-8034-d4e30a327ef9","resolution":{"observed_at":"2026-08-11T14:36:10.955397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.303233Z","title":"Automated Image Caption Generation Framework using Adaptive Attention and Bi-LSTM,","venue":null,"work_id":"d1a6b07f-8eaf-4128-ab6b-55f368eaf51d","year":2022},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.961891Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:547236dddaf34fc7902a049afe744215bc2019556d8d5cca37966cb97860fa2e","observation_id":"345def87-d7ed-485f-9fa0-666af389ba29","resolution":{"observed_at":"2026-08-11T14:36:12.308873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.283217Z","title":"Exploring region relationships implicitly: Image captioning with visual relationship attention,","venue":null,"work_id":"26a32195-03f0-4a05-be75-a9fa415e8b72","year":2021},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.966713Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:4d7c6fe1a1798970baba8f025b363e83d8cd3ea7d25786abf9c8417502217041","observation_id":"d09275ac-15c7-4c24-aae9-1dad69abcfa9","resolution":{"observed_at":"2026-08-11T14:36:12.288513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.265973Z","title":"Image captioning with semantic attention,","venue":null,"work_id":"19af072d-4e8d-4490-a340-cfd30514fc18","year":2016},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.971450Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:5e90f506f9213ca5ea070a53ab0b682283216ff5ce087e31223253fedbf3e66b","observation_id":"22b7618a-a8a4-4f26-afe7-4e2ad326f445","resolution":{"observed_at":"2026-08-11T14:36:12.271829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.247347Z","title":"DAA: Dual LSTMs with adaptive attention for image captioning,","venue":null,"work_id":"669f937a-c338-4d9e-b527-b4a0952ef77b","year":2019},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.976138Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:8876a6d2e1c60d612dad875b739609ed99161a961370fae5d6a5812b255110e2","observation_id":"d77e436a-9321-40e2-a9cc-cc86901e7698","resolution":{"observed_at":"2026-08-11T14:36:12.253096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.230235Z","title":"Task -Adaptive Attention for Image Captioning,","venue":null,"work_id":"07b2f777-f3a4-41ab-99af-405fa6f3b57c","year":2021},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.980764Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:acd561795ceb027171daf7d672651000d9f702d96d00125c6eb4db11d2daffa1","observation_id":"03224d93-cc52-4926-a6a4-692e450a64ad","resolution":{"observed_at":"2026-08-11T14:36:12.236033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.212148Z","title":"A New Attention -Based LSTM for Image Captioning,","venue":null,"work_id":"72b7b969-d466-461b-aa2d-ad334df4651f","year":2022},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.985439Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:989118f0e50120496a765eb6cd4e514b704b3d1f7a2aaa62426b556bcd18d6eb","observation_id":"108922a8-c154-4c2c-9afa-ac7d4715a6e9","resolution":{"observed_at":"2026-08-11T14:36:12.217603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.193111Z","title":"Semstyle: Learning to generate stylised image captions using unaligned text,","venue":null,"work_id":"1ed1b3a5-98b1-47ab-81d0-4760c3adfca9","year":2018},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.990398Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:1e3c3d13966c2684bc189ffe59e26939e7b15e36296c63bfb5ceae99280d55cb","observation_id":"e5de7fc4-29a8-46e5-961b-37513e79eb8f","resolution":{"observed_at":"2026-08-11T14:36:12.199066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.175882Z","title":"MemCap: Memorizing Style Knowledge for Image Captioning,","venue":null,"work_id":"06e92192-abc3-4379-bf8a-4e7008e7793a","year":2020},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:10.995823Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:e2aaf467f2299e6102d7f79bc9da606bb48710f17eb56c3c17ef969c2247281a","observation_id":"c8162142-c764-4cb3-aa13-41d35d8b6ea3","resolution":{"observed_at":"2026-08-11T14:36:12.181637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.157627Z","title":"SentiCap: Generating Image Descriptions with Sentiments,","venue":null,"work_id":"bc583161-f253-48be-a1d2-5be797d893be","year":2016},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.000464Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:7aca10735935e3ac95938a2874173e2fadc4f58271834826381e8f9dac6c037f","observation_id":"0da9e6ae-c127-46eb-9d2b-83efda56a66e","resolution":{"observed_at":"2026-08-11T14:36:12.163361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.10665","last_updated":"2019-03-20T16:53:33Z","snapshot_observed_at":"2026-08-14T18:09:41.509696Z","submitted_at":"2018-10-25T00:46:16Z","title":"Engaging Image Captioning Via Personality","version":2},"cited_work":{"arxiv_id":"1810.10665","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.10665","snapshot_observed_at":"2026-08-11T14:36:11.562139Z","title":"Engaging Image Captioning Via Personality","venue":"cs.CV","work_id":"7ff6a2b7-302b-4b84-85c3-7cf68576922a","year":2018},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.005630Z"},"links":{"cited_paper":"/paper/1810.10665","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:187a4ebc2a258f59952acfcfde3cce30170c9cb491c7c33f6f9eb70c31b06e57","observation_id":"a3c0135e-fea8-4499-9037-7684d658dcbd","resolution":{"observed_at":"2026-08-11T14:36:11.570178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.141319Z","title":"Image Captioning with Inherent Sentiment,","venue":null,"work_id":"37a2c136-53a5-4a6b-8338-342ee4c53cee","year":2021},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.011308Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:a49b5165a4a6647b7bf6cb9ac7e78b5db08c4b4f271ced6ff12f5883901aae08","observation_id":"1874a31d-42f9-4070-9c14-2930a52b7351","resolution":{"observed_at":"2026-08-11T14:36:12.146160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.124358Z","title":"Assessing shallow sentence scoring techniques and combinations for single and multi -document summarization,","venue":null,"work_id":"6eef8151-f409-489a-826e-f1f76d040985","year":2016},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.016846Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:4795f13218ab897b5101b8b9b6cc47fb12da99f6f4186f4ee5367a0ae3a85afe","observation_id":"a537017d-5d0b-4776-bbd1-e5fc6ccc864e","resolution":{"observed_at":"2026-08-11T14:36:12.130452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.104448Z","title":"Summarization of changes in dynamic text collections using latent dirichlet allocation model,","venue":null,"work_id":"b114e257-1abb-4500-b186-10041c447fec","year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.021446Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:2709102f7609ef28565cae5114af82906154188b22333786048984612095e3de","observation_id":"56e78d23-1f88-44ad-bda1-fd540323820b","resolution":{"observed_at":"2026-08-11T14:36:12.111973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.082982Z","title":"Fully abstractive approach to guided summarization,","venue":null,"work_id":"9494f193-9d9d-46e9-9b9c-f53298a8cd95","year":2012},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.026083Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:c15ea3ad20c4c9451a814f54595fae889864616b38284d0177b2043553583892","observation_id":"1aa3fc4a-b0db-43d3-9c23-af939f9a694c","resolution":{"observed_at":"2026-08-11T14:36:12.088961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.065750Z","title":"A bayesian method to incorporate background knowledge during automatic text summarization,","venue":null,"work_id":"6cc2470b-5c6c-455e-a9e3-a1cc4088a7f9","year":2014},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.031064Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:fcd15392af73ca4936592b8ff979cd2a7912defbaea87d431019c645e2a17f63","observation_id":"da0cebe7-cb25-43e9-85fa-fbd112c39daa","resolution":{"observed_at":"2026-08-11T14:36:12.071321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.034092Z","title":"Multi-document abstractive summarization using ilp based multi- sentence compression,","venue":null,"work_id":"b7d39d71-2257-42c7-b9bd-6c4f04803538","year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.036472Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:618656ac1b916730d2a648a42256f05efd553c109da072402d7fa35b7752288f","observation_id":"20c4642e-cead-4692-aaf1-361652a98d13","resolution":{"observed_at":"2026-08-11T14:36:12.039793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:12.015352Z","title":"A Neural Attention Model for Abstractive Sentence Summarization,","venue":null,"work_id":"0b5496f6-03d6-4359-9bd0-f6d01e1e0bf2","year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.042058Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:4dc2d6f739a1220717eab3fc10898cba1bb91ebe7bf7c14234c6ba8bf120b2a1","observation_id":"ea938668-5ea7-4883-afb0-bfd7a3a8a533","resolution":{"observed_at":"2026-08-11T14:36:12.021356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04368","last_updated":"2017-04-25T05:47:50Z","snapshot_observed_at":"2026-08-14T21:06:44.989948Z","submitted_at":"2017-04-14T07:55:19Z","title":"Get To The Point: Summarization with Pointer-Generator Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04368","snapshot_observed_at":"2026-08-11T14:36:11.047117Z","title":"Get To The Point: Summarization with Pointer-Generator Networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.047117Z"},"links":{"cited_paper":"/paper/1704.04368","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:f89251b37ce1493d91737dbe5cb25f9af5e4e5d332266bcd68ff627830a16527","observation_id":"12042d4a-1d45-4e75-9e77-d38f42b9c74d","resolution":{"observed_at":"2026-08-11T14:36:11.047117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.996369Z","title":"A Unified Model for Extractive and Abstractive Summarization using Inconsistency Loss,","venue":null,"work_id":"f1899e84-7b8c-4b4e-8e69-07e5719c4336","year":2018},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.052323Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:bf20a311e81c775608f1515d9751e6c5eb80ff1b01b1240e75ff839b59687001","observation_id":"e2b8f66f-c7e6-41cc-8af8-9d954a6c6ee9","resolution":{"observed_at":"2026-08-11T14:36:12.002684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.974274Z","title":"Abstractive Text Summarization with Multi-Head Attention,","venue":null,"work_id":"6d956e12-c491-41bf-9263-917ede2921f7","year":2019},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.057544Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:c0f50df1a792f481bccb553b2e8ee9c5d2726ef0d5a3d159e9de6f07e48b98a1","observation_id":"83847568-d1a2-4862-8d34-5c73e2586f0b","resolution":{"observed_at":"2026-08-11T14:36:11.980276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.956646Z","title":"Dual Encoding for Abstractive Text Summarization,","venue":null,"work_id":"f983d63b-7d26-45a5-8690-02c8b6461d7a","year":2020},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.062722Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:c352146e80c11456db48897e44c5f17613ae22982d0771c8993eee4154286064","observation_id":"f31f7f4a-d289-49f6-a958-b87adf3572fe","resolution":{"observed_at":"2026-08-11T14:36:11.962325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.934125Z","title":"Transformers and Pointer -Generator Networks for Abstractive Summarization,","venue":null,"work_id":"fa0850ea-d282-45ea-9234-e6f20cfa5f76","year":2019},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.068759Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:ab75900f1116c1a2123b914947da9d9ab452e6c5efafdec5cebb6d83f91c0215","observation_id":"9811558c-4640-4523-93b5-50752940949e","resolution":{"observed_at":"2026-08-11T14:36:11.941952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.911777Z","title":"Attention is all you need,","venue":null,"work_id":"c7a8b2cc-2da3-429c-879b-de6e68de008e","year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.074358Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:a13f8937814512b29e70b78bf9e0485498c348dc9161bea3d21c7647c9a346a9","observation_id":"089aa2d2-9225-44d1-96b8-dcbd8ca95a6b","resolution":{"observed_at":"2026-08-11T14:36:11.918274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.887951Z","title":"Faster R -CNN: Towards Real -Time Object Detection with Region Proposal Networks,","venue":null,"work_id":"f21c07c1-b701-4c52-b69f-c87aba922e23","year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.080758Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:1c6f2f6706b3ffa767ffcc6af4d75675eb2b808862c82da04c0ffc4d09c75278","observation_id":"8e325db5-da09-4cfb-92b1-85dcefa2b212","resolution":{"observed_at":"2026-08-11T14:36:11.896013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.864847Z","title":"Rethinking the Inception Architecture for Computer Vision,","venue":null,"work_id":"9b7563ae-8c7d-437d-aeb4-81f9db46f61b","year":2016},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.085932Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:b05bb936e1da56d32d6f3e89eaf70763a2148641314685e6640552133e9b5f1d","observation_id":"e104252a-d3f6-4ed9-86c8-bd1b1914b898","resolution":{"observed_at":"2026-08-11T14:36:11.870867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06114","last_updated":"2016-03-01T10:55:58Z","snapshot_observed_at":"2026-08-14T22:22:15.501004Z","submitted_at":"2015-11-19T10:24:14Z","title":"Multi-task Sequence to Sequence Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06114","snapshot_observed_at":"2026-08-11T14:36:11.097117Z","title":"Multi -task Sequence to Sequence Learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.097117Z"},"links":{"cited_paper":"/paper/1511.06114","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:d69e6ddfeda91c4ba6ad549c15579684893aa66558d62b416928d342aa145b10","observation_id":"5e309434-f6e0-4d60-8c99-cbddadbca44d","resolution":{"observed_at":"2026-08-11T14:36:11.097117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.04606","last_updated":"2017-06-19T17:41:07Z","snapshot_observed_at":"2026-08-14T21:48:11.385984Z","submitted_at":"2016-07-15T18:27:55Z","title":"Enriching Word Vectors with Subword Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.04606","snapshot_observed_at":"2026-08-11T14:36:11.103396Z","title":"Enriching Word Vectors with Subword Information,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.103396Z"},"links":{"cited_paper":"/paper/1607.04606","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:cd0f0b318dd5e17bf00326d4843adc901a32f953ee3d144ba3e52fce34665f69","observation_id":"6cae5062-235b-4406-b893-5946ea0e7a14","resolution":{"observed_at":"2026-08-11T14:36:11.103396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-11T14:36:11.109445Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.109445Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:2530f569c8ece58e44a89e9dbafeb2748765605bf876c2b0bfc89e1271187cfa","observation_id":"3108421a-ec0f-4d30-bdf3-93b674cf8a3a","resolution":{"observed_at":"2026-08-11T14:36:11.109445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.04521","last_updated":"2017-02-15T09:45:23Z","snapshot_observed_at":"2026-08-14T21:16:24.745004Z","submitted_at":"2017-02-15T09:45:23Z","title":"Frustratingly Short Attention Spans in Neural Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.04521","snapshot_observed_at":"2026-08-11T14:36:11.115085Z","title":"Frustratingly Short Attention Spans in Neural Language Modeling,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.115085Z"},"links":{"cited_paper":"/paper/1702.04521","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:ea246b4c74f0cdb4c3602be221060589ab0b43d3a3d99c121937341afb2fc83b","observation_id":"8b0095c1-55e1-48c6-b54c-c2a77eecdb8c","resolution":{"observed_at":"2026-08-11T14:36:11.115085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.843453Z","title":"\"Bleu: a method for automatic evaluation of machine,","venue":null,"work_id":"947320db-068c-45b0-ba85-e5da82a0bc14","year":2002},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.121019Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:48dff15cc9178c21e6af7ac9f6d973108c8b3988ead989e1eb281700fffd8d35","observation_id":"8881e44a-09cd-42bd-88c7-04f9f25b7727","resolution":{"observed_at":"2026-08-11T14:36:11.851559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.824346Z","title":"Meteor: An automatic Metric for MT Evaluation with Improved Correlation with Human Judgments,","venue":null,"work_id":"75b90f57-b2f7-4890-a487-cbc8ff2a0c50","year":2005},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.126492Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:cd71bd7c6372089e44a03ae59693b25cec2300a70d6d95b8ea2bb2087424f4fb","observation_id":"8655df51-9866-471b-917d-9e0ad80521d6","resolution":{"observed_at":"2026-08-11T14:36:11.829860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T14:36:11.131790Z","title":"Adam: A method for stochastic,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.131790Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:94def19afc6c1b146e522d884ccc89fc43f30dbb3c4de17aa9620f7da002af40","observation_id":"daf48de2-ca23-4cf0-b01c-5c43d8937fd1","resolution":{"observed_at":"2026-08-11T14:36:11.131790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.04942","last_updated":"2015-09-16T15:02:30Z","snapshot_observed_at":"2026-08-14T22:32:08.396268Z","submitted_at":"2015-09-16T15:02:30Z","title":"Guiding Long-Short Term Memory for Image Caption Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.04942","snapshot_observed_at":"2026-08-11T14:36:11.137805Z","title":"Guiding the long -short term memory model for image caption Generation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.137805Z"},"links":{"cited_paper":"/paper/1509.04942","citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:92948108820f7b2d0dac7694b18db9e43e5d8f085ea63415901238cd05df4357","observation_id":"d136edbe-af6d-4c0e-ad07-036ae801d9f5","resolution":{"observed_at":"2026-08-11T14:36:11.137805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.803290Z","title":"Multimodal Neural Language Models,","venue":null,"work_id":"7843f868-1d03-4cef-92db-24486fcb6807","year":2014},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.143935Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:3a648dc6fbb385443b0de306569bc46366090211472b542ea26259a811ab15b8","observation_id":"edd66cae-c832-4555-8578-81dfcc8d6827","resolution":{"observed_at":"2026-08-11T14:36:11.809439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.784117Z","title":"Stimulus -driven and concept -driven analysis for image caption generation,","venue":null,"work_id":"3216dad6-d2b5-48d2-824b-fcc9622a491d","year":2020},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.300760Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:8743ec4a53e5ad1ae7eb26f96aaa30ea8bc138e7344cff82c45357e2edcb8498","observation_id":"edec3636-92a0-4326-8948-9a33998384ae","resolution":{"observed_at":"2026-08-11T14:36:11.790431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.759950Z","title":"Learning joint relationship attention network for image captioning,","venue":null,"work_id":"791fdfc8-8a0a-491c-9a5d-481d1a28a4f5","year":2023},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.308224Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:8b5b7d27bb198cf77e93a3a2768584580b8ac0b62c5a1606213062d7315da3d3","observation_id":"e96a5079-addf-4e18-a5f1-4d1694cab461","resolution":{"observed_at":"2026-08-11T14:36:11.767496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.737462Z","title":"Detach and Attach: Stylized Image Captioning without Paired Stylized Dataset,","venue":null,"work_id":"24c76234-cdd9-4304-b791-b7ad1946b137","year":2022},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.318914Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:656b43e7d69cb9397d90a071de1866a4b70cef69f41fc47b5148409a45839551","observation_id":"17f63919-fb5b-4918-8536-1997f245ab32","resolution":{"observed_at":"2026-08-11T14:36:11.742491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:36:11.715853Z","title":"Learning Cooperative Neural Modules for Stylized Image Captioning,","venue":null,"work_id":"65bf63a4-55d4-49a0-96b6-88a8ce5df8f5","year":2022},"citing_paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:11.326499Z"},"links":{"citing_paper":"/paper/2412.11836"},"observation_digest":"sha256:1d05c938805c9cd7ebfb8e2eaa167f8a1ac3a9e5ef77a0978aa868e1253eb727","observation_id":"52339b4d-69e0-4388-93a6-d780ad4cc7fc","resolution":{"observed_at":"2026-08-11T14:36:11.723077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11836","last_updated":"2024-12-16T14:57:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:55:39.617050Z","submitted_at":"2024-12-16T14:57:40Z","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":3,"verified_fuzzy":51},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2412.11836."}